Modelo de qualidade

Como medimos a qualidade da anotação

Ou a qualidade é um número sobre o qual você pode agir, ou é uma opinião. Esta página explica exatamente quais números produzimos, como são calculados, o que eles conseguem e não conseguem dizer, e o que chega no relatório de QA a cada lote.

Todo número exibido neste site como exemplo está identificado como exemplo. Não publicamos garantias de acurácia, porque uma garantia dada antes de ver os seus dados não é um compromisso — é um número de marketing.

A qualidade é projetada, não inspecionada

Uma inspeção final consegue pegar erros. Ela não consegue pegar ambiguidade, e é a ambiguidade que de fato degrada um conjunto de dados em japonês. Se a diretriz permite duas leituras de um caso, as duas passam pela inspeção, e a inconsistência chega aos dados de treinamento com atestado de saúde.

Por isso o trabalho que determina a qualidade acontece antes da anotação: escrever a diretriz, quebrá-la em casos-limite reais durante um piloto, medir se anotadores independentes convergem e corrigir a diretriz onde eles não convergem. A revisão é a segunda linha de defesa, não a primeira.

O que segue é o sistema inteiro, incluindo as partes desconfortáveis de publicar — o que cada métrica deixa de capturar e onde um número pode parecer saudável enquanto o conjunto de dados não está.

Resumo

Medida por
Concordância entre anotadores, acurácia medida no gold set, taxa de arbitragem e desvio de rótulos.
Reportada por
Lote, com detalhamento por rótulo e por critério, em vez de um número único misturado.
Profundidade da revisão
Definida por projeto. Revisão mais profunda onde há julgamento, mais leve onde a tarefa é mecânica.
Divergências
Arbitradas por escrito por um revisor sênior e escritas de volta na diretriz.
O que não fazemos
Publicar garantias de acurácia ou citar um número medido em outro projeto.

O sistema

Seis etapas, em funcionamento contínuo

Este ciclo roda durante todo o projeto, não uma única vez no início.

  1. 01

    Especificar

    A diretriz é escrita com exemplos comentados e contraexemplos para cada decisão que a tarefa exige. Tudo o que ficar implícito aqui vira inconsistência depois.

  2. 02

    Calibrar

    Os anotadores rotulam o mesmo conjunto de calibração de forma independente. A divergência mostra onde a diretriz está ambígua — corrige-se a diretriz, não o anotador.

  3. 03

    Anotar

    Trabalho de produção, com a versão da diretriz registrada em cada item, para que uma dúvida posterior sobre um registro possa ser respondida com precisão.

  4. 04

    Revisar

    Um segundo anotador revisa na profundidade que a tarefa exige. A revisão é um papel próprio, com critérios próprios, e não uma repetição mais rápida da anotação.

  5. 05

    Arbitrar

    As divergências vão para um revisor sênior, que registra a resolução e o motivo. Toda resolução vira um exemplo comentado na diretriz.

  6. 06

    Medir e realimentar

    Concordância, acurácia no gold set e desvio são calculados por lote, comparados com os lotes anteriores e usados para decidir onde a próxima revisão da diretriz é necessária.

Métricas

O que cada número realmente significa

Definidas aqui para que um número em um relatório de QA seja interpretável sem que você precise perguntar a que ele se refere.

Concordância entre anotadores
Com que frequência anotadores independentes produzem o mesmo rótulo para o mesmo item. É reportada como concordância bruta junto de um coeficiente corrigido pelo acaso, porque a concordância bruta em uma taxonomia desbalanceada pode parecer excelente sem carregar quase nenhuma informação.
κ de Cohen / α de Krippendorff
Coeficientes de concordância corrigidos pelo acaso. O κ de Cohen para dois anotadores em rótulos categóricos; o α de Krippendorff quando há mais de dois anotadores, julgamentos faltantes ou escalas ordinais. Qual deles foi usado é declarado no relatório, e não deixado implícito.
Acurácia no gold set
Acurácia em relação a um conjunto de referência anotado e arbitrado por revisores sêniores. Mede correção, e não consistência — dois anotadores podem concordar perfeitamente e ambos estar errados, algo que as estatísticas de concordância sozinhas nunca revelam.
Taxa de arbitragem
A proporção de itens que precisaram de um revisor sênior para serem resolvidos. Uma taxa de arbitragem em alta costuma ser o sinal mais precoce de que os dados mudaram ou de que a diretriz tem uma lacuna, e ela se move antes da acurácia.
Desvio de rótulos
Movimento na distribuição dos rótulos ou no comportamento dos anotadores ao longo do tempo. Projetos longos desviam por razões corriqueiras — os dados de origem mudam, os anotadores ficam mais confiantes — e o monitoramento de desvio é o que separa isso de uma degradação real.
Concordância de fronteira
Em tarefas de span, o quanto os anotadores concordam sobre onde um span começa e termina, reportado separadamente da concordância sobre o rótulo. Um conjunto de spans em japonês pode ter excelente concordância de rótulo e fronteiras inutilizáveis.

Visão geral da qualidade

Painel de QA (exemplo)

Concordância

97.8%

2.1% vs. últimos 7 dias

Acurácia no gold set

98.6%

1.4% vs. últimos 7 dias

Itens revisados

24826

18.7% nesta semana

Divergências abertas

18

12 vs. últimos 7 dias

Desvio de rótulos (30 dias)

Desvio observado Limite de alerta
0%2.5%5% Day 1Day 8Day 15Day 22Day 30

Resumo de qualidade

  • Aderência às diretrizes
  • Calibração dos revisores
  • Monitoramento de outliers
  • Detecção de desvio

Interface ilustrativa. Os números exibidos são dados de exemplo, usados para explicar como monitoramos a qualidade, e não resultados apurados.

Revisão

Quanto de um lote é revisado

A profundidade da revisão é uma configuração do projeto, acordada com você e declarada em contrato. Mais pesado nem sempre é melhor — uma tarefa mecânica revisada em profundidade total gasta orçamento onde não há julgamento a fazer.

Configurações de revisão ilustrativas. A profundidade real de um projeto é acordada na definição de escopo.
Profundidade da revisãoUsada normalmente paraO que acontece
Revisão por amostragemTarefas mecânicas de alto volume com concordância estávelUma parcela definida dos itens é revisada; falhas disparam uma passagem mais ampla
Segunda passagem completaRotulagem dependente de julgamento e a maior parte do trabalho com spans em japonêsCada item é revisado por um segundo anotador
Dupla anotação às cegasConjuntos de avaliação, benchmarks e gold setsDois anotadores trabalham de forma independente; todas as divergências são arbitradas
Revisão por especialistaDomínios regulados e julgamento profissionalUm especialista de domínio revisa, com raciocínio escrito nos itens contestados

Taxonomia de erros

Dar nome às falhas

Um defeito que tem nome pode ser contado, acompanhado ao longo do tempo e corrigido. Uma contagem genérica de “erros” não diz o que mudar.

Lacuna na diretriz

O caso não é coberto pela diretriz. Corrige-se revisando a diretriz, não corrigindo o item — caso contrário o mesmo caso vai se repetir.

Aplicação incorreta da diretriz

O caso é coberto e o anotador aplicou a regra de forma errada. Corrige-se com feedback e, se voltar a acontecer, com um exemplo comentado mais claro.

Erro de fronteira

O rótulo está certo e o span não. É específico do trabalho com spans em japonês, onde as regras de fronteira e a tokenização interagem.

Erro de registro ou de nuance

Linguisticamente correto, socialmente errado: o nível de polidez errado, ou uma recusa suave demais para soar como recusa.

Erro factual

Um dado verificável está errado — uma afirmação, a leitura de um nome, um número. Distingue-se dos erros de julgamento porque a correção é verificação, não calibração.

Defeito de origem

O próprio item é inutilizável — áudio inaudível, digitalização ilegível, prompt ambíguo. É sinalizado e devolvido, nunca preenchido com um palpite plausível.

Relatórios

O que acompanha cada lote

O relatório é desenhado para que você consiga auditar o lote sem nos ter na sala.

  • Números de concordância por rótulo ou critério, com o coeficiente usado declarado explicitamente.
  • Acurácia no gold set do lote e a tendência em relação aos lotes anteriores.
  • Taxa de arbitragem, com o log de arbitragem e o raciocínio registrado para cada resolução.
  • Contagens de erro detalhadas pela taxonomia acima, em vez de um total único de defeitos.
  • A versão da diretriz contra a qual o lote foi anotado e um changelog em relação à versão anterior.
  • Itens sinalizados como defeitos de origem, listados em vez de descartados silenciosamente.

FAQ

Sobre a medição de qualidade

Perguntas sobre o que estes números provam e o que não provam.

Não publicamos garantia de acurácia, e trataríamos com cautela a garantia de qualquer fornecedor. A acurácia alcançável depende da tarefa, da taxonomia, da qualidade dos dados de origem e de quanta ambiguidade genuína o domínio contém — nada disso é conhecido antes de um piloto. O que assumimos como compromisso é o método de medição: quais métricas, calculadas como, reportadas com que frequência e o que acontece quando um lote fica abaixo do esperado. Depois de um piloto com os seus dados, podemos falar de metas realistas, porque aí há algo real sobre o que conversar.

São dados de exemplo. Existem para mostrar o que a interface reporta e como as métricas se comportam em movimento, e por isso mesmo aparecem com um selo e um aviso visíveis. Não são resultados de um projeto de cliente, e não os apresentaremos como tal.

Não por si só. A concordância mede consistência, não correção — anotadores que compartilham o mesmo mal-entendido concordam perfeitamente. Ela também é inflada por taxonomias desbalanceadas, e é por isso que reportamos um coeficiente corrigido pelo acaso ao lado da concordância bruta, e por isso que existem gold sets arbitrados por revisores sêniores como verificação independente da correção.

Ele não é entregue. Dependendo da falha, a resposta é reanotação direcionada, revisão da diretriz seguida de retrabalho dos itens afetados, ou escalonamento para você quando a causa está a montante — uma taxonomia ambígua ou dados de origem que não sustentam a tarefa. Preferimos entregar com atraso e uma explicação a entregar no prazo um número que não vai sobreviver ao contato com o seu modelo.

Podem, e é uma coisa razoável de se pedir. Vocês podem revisar a diretriz e seu histórico de versões, pegar uma amostra para pontuação independente e comparar os seus achados com os números que reportamos. Quando um cliente roda o próprio QA em paralelo, tratamos a divergência entre os dois como um achado que merece investigação, e não como uma disputa a ser vencida.

Qualidade

Peça os números sobre os seus próprios dados.

Um piloto produz números reais de concordância, um detalhamento real de erros e uma visão honesta de quais partes da sua taxonomia vão se sustentar em volume.

NDA antes de você compartilhar qualquer dado. A definição do escopo do piloto é gratuita.