Avaliação e feedback humano

Avaliação de LLM em japonês e feedback humano

Julgamento humano estruturado sobre o que o seu modelo de fato produz em japonês — pontuado por falantes nativos segundo uma rubrica escrita, com a concordância medida e as divergências arbitradas por escrito.

Uma avaliação vale o que vale a sua rubrica. Se dois falantes competentes de japonês pontuam a mesma resposta de formas diferentes e não sabem dizer por quê, o número que sai dali é ruído com uma casa decimal para disfarçar.

Por que uma avaliação em japonês precisa de avaliadores japoneses

Métricas automáticas e esquemas de LLM como juiz são úteis para acompanhar uma tendência e pouco confiáveis justamente para as falhas que mais importam em japonês. Um modelo juiz treinado sobretudo em inglês aprova sem hesitar uma resposta cujo nível de polidez está errado para a situação, cuja recusa é suave demais para soar como recusa ou cujos honoríficos contradizem a relação estabelecida três turnos antes. Esses são os erros que um usuário japonês nota de imediato e que uma métrica não nota de jeito nenhum.

Por isso avaliamos como faria um revisor cuidadoso, mas tornando a revisão reproduzível: rubricas ancoradas com exemplos comentados em cada ponto da escala, calibração antes de a pontuação começar, dupla pontuação às cegas em uma amostra e arbitragem escrita quando os avaliadores divergem. O resultado é um conjunto de números que você consegue defender, junto com o raciocínio que os produziu.

Também tratamos a independência como uma restrição de projeto. Os avaliadores de um projeto não são as pessoas que escreveram seus dados de treinamento, porque quem pontua a própria diretriz tende a pontuá-la com generosidade.

Resumo

Tipos de avaliação
Preferência pareada, pontuação por rubrica, factualidade e grounding, segurança e red teaming, construção de benchmarks.
Pontuada por
Falantes nativos no Japão; especialistas de domínio quando o assunto exige.
Reportada com
Concordância entre avaliadores, taxa de arbitragem, detalhamento por critério e as notas completas de pontuação.
Independência
Os avaliadores não são os anotadores que escreveram os seus dados de treinamento.
Repetibilidade
As rubricas são versionadas, de modo que uma rodada posterior é comparável a uma anterior.

Tipos de avaliação

O que avaliamos

Perguntas diferentes pedem instrumentos diferentes. A maioria dos programas roda dois ou três destes sobre o mesmo modelo.

Preferência pareada

Duas respostas ao mesmo prompt, comparadas segundo critérios escritos. É a forma mais robusta de comparar versões de modelo, porque um julgamento relativo é bem mais estável do que uma pontuação absoluta.

  • Comparação A/B de modelos
  • Empates registrados explicitamente
  • Preferência por critério
  • Ordenação controlada contra viés de posição

Pontuação por rubrica

Pontuações absolutas em critérios nomeados — acurácia, utilidade, registro, formatação, segurança —, cada um com descrições ancoradas do que significa cada nota.

  • Escalas ordinais ancoradas
  • Pontuações por critério, não um número único misturado
  • Justificativa obrigatória em notas baixas
  • Rubrica versionada por rodada

Factualidade e grounding

Se uma afirmação é verdadeira e se ela é de fato sustentada pela passagem fornecida ao modelo. São falhas diferentes e são pontuadas separadamente.

  • Verificação no nível da afirmação
  • Conferência dos spans de citação
  • Detecção de afirmações sem respaldo
  • Verificação em fontes japonesas

Segurança e red teaming

Prompts adversariais escritos em japonês por falantes de japonês, incluindo as formulações indiretas e eufemísticas que conjuntos traduzidos nunca contêm.

  • Conjuntos de ataque por categoria
  • Sondagem de recusa excessiva
  • Riscos sociais e jurídicos próprios do Japão
  • Achados marcados por severidade

Construção de benchmarks

Um conjunto de avaliação reservado, construído para o seu domínio, com itens desenhados para discriminar em vez de serem respondidos corretamente por qualquer modelo.

  • Conjuntos de itens equilibrados por dificuldade
  • Curadoria atenta a contaminação
  • Respostas de referência com variantes aceitáveis
  • Harness de pontuação reutilizável

Especificidades do japonês

O que uma avaliação não japonesa deixa passar

Cada um destes pontos é invisível para um modelo juiz treinado em inglês e óbvio para um leitor japonês.

Adequação do registro

Uma resposta pode ser gramatical, precisa e ainda assim errada, porque se dirige a um cliente no registro que você usaria com um colega. Em japonês, a polidez é um eixo de correção, não de estilo.

Como tratamos O registro é um critério nomeado da rubrica, com suas próprias âncoras, pontuado separadamente da acurácia, para que uma resposta bem informada mas mal registrada não se esconda atrás do conteúdo.

Força da recusa

As recusas em japonês são indiretas por padrão. Um modelo que responde a um pedido proibido com 難しいかもしれません tecnicamente hesitou, e muitos esquemas de avaliação pontuam isso como uma recusa bem-sucedida.

Como tratamos As recusas são pontuadas conforme quem fala japonês as leria ou não como recusa, em uma escala com exemplos comentados, e a recusa excessiva é pontuada como falha própria, não como acerto.

Consistência dos honoríficos entre turnos

A relação estabelecida no início de uma conversa condiciona todos os turnos seguintes. Os modelos frequentemente a reiniciam no meio do diálogo, o que soa a um usuário japonês como o assistente esquecendo com quem está falando.

Como tratamos Os itens multiturno são pontuados como conversas, com um critério de consistência que olha para o conjunto dos turnos, e não para cada resposta isoladamente.

Entidades nomeadas e leituras

Os nomes próprios japoneses têm várias leituras válidas, e um modelo que produz a leitura errada de um nome de pessoa ou de lugar comete um erro factual que a correção ortográfica não enxerga.

Como tratamos Erros de entidade e de leitura formam uma subcategoria própria de factualidade, verificada em fontes japonesas e não na memória do avaliador.

Processo

Como uma avaliação é conduzida

A rubrica é o entregável que sobrevive à rodada. É o que torna a próxima avaliação comparável a esta.

  1. 01

    Definir o que significa “bom”

    Transformamos as suas preocupações de qualidade em critérios nomeados e depois escrevemos descrições ancoradas para cada ponto da escala, com exemplos reais da saída do seu próprio modelo.

  2. 02

    Montar o conjunto de itens

    Os prompts são amostrados ou escritos para cobrir os comportamentos que importam para você, incluindo os casos raros e adversariais que uma amostragem aleatória nunca traria à tona.

  3. 03

    Calibrar os avaliadores

    Todos os avaliadores pontuam o mesmo lote de calibração. A divergência é discutida, as âncoras da rubrica são afinadas, e a pontuação só começa quando a concordância está estável.

  4. 04

    Pontuar, pontuar em dobro, arbitrar

    Uma parcela definida dos itens é pontuada às cegas por dois avaliadores. As divergências vão para um revisor sênior, que registra o motivo da resolução.

  5. 05

    Reportar com o raciocínio

    Você recebe as pontuações, as estatísticas de concordância, o log de arbitragem e um resumo escrito dos padrões de falha recorrentes — não apenas uma linha de ranking.

Entrega

O que você recebe

Cada pontuação é rastreável até um item, um papel de avaliador, uma versão de rubrica e, quando houve uma, uma justificativa.

Entregáveis padrão de avaliação. O formato do harness de pontuação é ajustado ao seu stack, quando você tem um.
EntregávelFormatoConteúdo
Pontuações por itemJSONL ou CSVid do item, pontuações por critério, justificativa, papel do avaliador, versão da rubrica
Relatório de concordânciaPDF ou Markdownconcordância entre avaliadores por critério, taxa de arbitragem, desvio ao longo da rodada
Análise de falhasPDF ou Markdownpadrões recorrentes, exemplos comentados, mudanças sugeridas na diretriz ou nos dados
Achados de red teamJSONLprompt, resposta, categoria, severidade, notas de reprodução
Conjunto de benchmarkJSONL mais harnessitens, respostas de referência, variantes aceitáveis, script de pontuação

Qualidade

Controles específicos deste trabalho

Uma avaliação sem estatísticas de concordância é uma opinião. Estas são as verificações que a transformam em medição.

  • Rodada de calibração antes da pontuação, repetida sempre que a rubrica muda.
  • Dupla pontuação às cegas em uma amostra definida, com a concordância reportada por critério em vez de misturada.
  • Arbitragem escrita para cada divergência, mantida como um log que você recebe junto com os resultados.
  • Ordem das respostas randomizada nas comparações pareadas, para controlar o viés de posição.
  • Avaliadores mantidos separados do time que produziu os dados de treinamento do mesmo projeto.
  • Versionamento da rubrica, para que uma nova rodada meses depois meça a mesma coisa que mediu antes.

FAQ

Sobre avaliação de LLM

O que os times perguntam antes de encomendar uma primeira avaliação em japonês.

Juízes LLM são baratos, rápidos e úteis para acompanhar regressões entre releases. Eles são pouco confiáveis exatamente onde o japonês é difícil — adequação da polidez, força da recusa, consistência dos honoríficos e leitura de nomes —, porque esses julgamentos dependem de conhecimento pragmático nativo. Um arranjo comum é ter um conjunto pontuado por humanos como referência, um juiz LLM para as rodadas frequentes e repontuação humana periódica para checar se o juiz não se afastou da referência.

Depende do tamanho da diferença que você precisa detectar e de quantos critérios está pontuando. Algumas centenas de itens bem escolhidos costumam separar dois modelos claramente distintos; distinguir checkpoints quase equivalentes exige bastante mais. Dimensionamos o conjunto em função da decisão que você quer tomar, e avisamos quando um conjunto é pequeno demais para sustentar a conclusão que você espera dele.

Sim. Para assuntos como questões jurídicas, tributárias, contábeis, trabalhistas ou de registro de empresas, montamos a equipe de avaliação em torno da expertise que a tarefa exige. Não mantemos um quadro fixo de profissionais habilitados — a disponibilidade é avaliada projeto a projeto conforme escopo, volume e prazo, e confirmamos o que é viável antes de o trabalho começar.

Avaliamos, mas não com as mesmas pessoas. Os avaliadores de um projeto são separados dos anotadores que escreveram seus dados de treinamento, porque pontuar segundo uma diretriz que você ajudou a escrever não é uma medição independente. Se você preferir que a avaliação fique inteiramente fora do fornecedor que produziu os dados, achamos que é uma posição razoável e diremos isso.

Os resultados, mais a análise de falhas que os explica. Um relatório que só contém uma nota não é acionável — o que você precisa são os padrões recorrentes por trás dela, exemplos comentados de cada um e uma visão concreta sobre se a correção é mais dados, uma diretriz diferente ou uma mudança no produto. Preferimos entregar com clareza um achado incômodo a suavizá-lo.

Avaliação de LLM

Descubra o que o seu modelo erra em japonês.

Envie um conjunto de saídas do modelo ou os prompts com os quais você quer testá-lo. Voltamos com uma proposta de rubrica, uma amostra pontuada por ela e o que envolveria uma rodada completa.

NDA antes de você compartilhar qualquer dado. A definição do escopo do piloto é gratuita.