Lacuna na diretriz
O caso não é coberto pela diretriz. Corrige-se revisando a diretriz, não corrigindo o item — caso contrário o mesmo caso vai se repetir.
Modelo de qualidade
Ou a qualidade é um número sobre o qual você pode agir, ou é uma opinião. Esta página explica exatamente quais números produzimos, como são calculados, o que eles conseguem e não conseguem dizer, e o que chega no relatório de QA a cada lote.
Todo número exibido neste site como exemplo está identificado como exemplo. Não publicamos garantias de acurácia, porque uma garantia dada antes de ver os seus dados não é um compromisso — é um número de marketing.
Uma inspeção final consegue pegar erros. Ela não consegue pegar ambiguidade, e é a ambiguidade que de fato degrada um conjunto de dados em japonês. Se a diretriz permite duas leituras de um caso, as duas passam pela inspeção, e a inconsistência chega aos dados de treinamento com atestado de saúde.
Por isso o trabalho que determina a qualidade acontece antes da anotação: escrever a diretriz, quebrá-la em casos-limite reais durante um piloto, medir se anotadores independentes convergem e corrigir a diretriz onde eles não convergem. A revisão é a segunda linha de defesa, não a primeira.
O que segue é o sistema inteiro, incluindo as partes desconfortáveis de publicar — o que cada métrica deixa de capturar e onde um número pode parecer saudável enquanto o conjunto de dados não está.
Resumo
O sistema
Este ciclo roda durante todo o projeto, não uma única vez no início.
A diretriz é escrita com exemplos comentados e contraexemplos para cada decisão que a tarefa exige. Tudo o que ficar implícito aqui vira inconsistência depois.
Os anotadores rotulam o mesmo conjunto de calibração de forma independente. A divergência mostra onde a diretriz está ambígua — corrige-se a diretriz, não o anotador.
Trabalho de produção, com a versão da diretriz registrada em cada item, para que uma dúvida posterior sobre um registro possa ser respondida com precisão.
Um segundo anotador revisa na profundidade que a tarefa exige. A revisão é um papel próprio, com critérios próprios, e não uma repetição mais rápida da anotação.
As divergências vão para um revisor sênior, que registra a resolução e o motivo. Toda resolução vira um exemplo comentado na diretriz.
Concordância, acurácia no gold set e desvio são calculados por lote, comparados com os lotes anteriores e usados para decidir onde a próxima revisão da diretriz é necessária.
Métricas
Definidas aqui para que um número em um relatório de QA seja interpretável sem que você precise perguntar a que ele se refere.
Concordância
97.8%
2.1% vs. últimos 7 dias
Acurácia no gold set
98.6%
1.4% vs. últimos 7 dias
Itens revisados
24826
18.7% nesta semana
Divergências abertas
18
12 vs. últimos 7 dias
Interface ilustrativa. Os números exibidos são dados de exemplo, usados para explicar como monitoramos a qualidade, e não resultados apurados.
Revisão
A profundidade da revisão é uma configuração do projeto, acordada com você e declarada em contrato. Mais pesado nem sempre é melhor — uma tarefa mecânica revisada em profundidade total gasta orçamento onde não há julgamento a fazer.
| Profundidade da revisão | Usada normalmente para | O que acontece |
|---|---|---|
| Revisão por amostragem | Tarefas mecânicas de alto volume com concordância estável | Uma parcela definida dos itens é revisada; falhas disparam uma passagem mais ampla |
| Segunda passagem completa | Rotulagem dependente de julgamento e a maior parte do trabalho com spans em japonês | Cada item é revisado por um segundo anotador |
| Dupla anotação às cegas | Conjuntos de avaliação, benchmarks e gold sets | Dois anotadores trabalham de forma independente; todas as divergências são arbitradas |
| Revisão por especialista | Domínios regulados e julgamento profissional | Um especialista de domínio revisa, com raciocínio escrito nos itens contestados |
Taxonomia de erros
Um defeito que tem nome pode ser contado, acompanhado ao longo do tempo e corrigido. Uma contagem genérica de “erros” não diz o que mudar.
O caso não é coberto pela diretriz. Corrige-se revisando a diretriz, não corrigindo o item — caso contrário o mesmo caso vai se repetir.
O caso é coberto e o anotador aplicou a regra de forma errada. Corrige-se com feedback e, se voltar a acontecer, com um exemplo comentado mais claro.
O rótulo está certo e o span não. É específico do trabalho com spans em japonês, onde as regras de fronteira e a tokenização interagem.
Linguisticamente correto, socialmente errado: o nível de polidez errado, ou uma recusa suave demais para soar como recusa.
Um dado verificável está errado — uma afirmação, a leitura de um nome, um número. Distingue-se dos erros de julgamento porque a correção é verificação, não calibração.
O próprio item é inutilizável — áudio inaudível, digitalização ilegível, prompt ambíguo. É sinalizado e devolvido, nunca preenchido com um palpite plausível.
Relatórios
O relatório é desenhado para que você consiga auditar o lote sem nos ter na sala.
FAQ
Perguntas sobre o que estes números provam e o que não provam.
Não publicamos garantia de acurácia, e trataríamos com cautela a garantia de qualquer fornecedor. A acurácia alcançável depende da tarefa, da taxonomia, da qualidade dos dados de origem e de quanta ambiguidade genuína o domínio contém — nada disso é conhecido antes de um piloto. O que assumimos como compromisso é o método de medição: quais métricas, calculadas como, reportadas com que frequência e o que acontece quando um lote fica abaixo do esperado. Depois de um piloto com os seus dados, podemos falar de metas realistas, porque aí há algo real sobre o que conversar.
São dados de exemplo. Existem para mostrar o que a interface reporta e como as métricas se comportam em movimento, e por isso mesmo aparecem com um selo e um aviso visíveis. Não são resultados de um projeto de cliente, e não os apresentaremos como tal.
Não por si só. A concordância mede consistência, não correção — anotadores que compartilham o mesmo mal-entendido concordam perfeitamente. Ela também é inflada por taxonomias desbalanceadas, e é por isso que reportamos um coeficiente corrigido pelo acaso ao lado da concordância bruta, e por isso que existem gold sets arbitrados por revisores sêniores como verificação independente da correção.
Ele não é entregue. Dependendo da falha, a resposta é reanotação direcionada, revisão da diretriz seguida de retrabalho dos itens afetados, ou escalonamento para você quando a causa está a montante — uma taxonomia ambígua ou dados de origem que não sustentam a tarefa. Preferimos entregar com atraso e uma explicação a entregar no prazo um número que não vai sobreviver ao contato com o seu modelo.
Podem, e é uma coisa razoável de se pedir. Vocês podem revisar a diretriz e seu histórico de versões, pegar uma amostra para pontuação independente e comparar os seus achados com os números que reportamos. Quando um cliente roda o próprio QA em paralelo, tratamos a divergência entre os dois como um achado que merece investigação, e não como uma disputa a ser vencida.
Qualidade
Um piloto produz números reais de concordância, um detalhamento real de erros e uma visão honesta de quais partes da sua taxonomia vão se sustentar em volume.
NDA antes de você compartilhar qualquer dado. A definição do escopo do piloto é gratuita.