Evaluación y retroalimentación humana

Evaluación de LLM en japonés y retroalimentación humana

Criterio humano estructurado sobre lo que su modelo produce realmente en japonés, puntuado por hablantes nativos conforme a una rúbrica escrita, con el acuerdo medido y las discrepancias dirimidas por escrito.

Una evaluación vale lo que vale su rúbrica. Si dos hablantes competentes de japonés puntúan la misma respuesta de forma distinta y no saben decir por qué, el número que sale es ruido con un decimal puesto.

Por qué la evaluación en japonés necesita evaluadores japoneses

Las métricas automáticas y los esquemas de LLM como juez sirven para seguir una tendencia y no son fiables justo en los fallos que más importan en japonés. Un modelo juez entrenado sobre todo en inglés aprobará sin problema una respuesta cuyo nivel de cortesía es inadecuado para la situación, cuyo rechazo es demasiado suave para leerse como tal o cuyos honoríficos contradicen la relación establecida tres turnos antes. Son errores que un usuario japonés detecta de inmediato y que una métrica no detecta en absoluto.

Por eso evaluamos como lo haría un revisor cuidadoso, pero haciendo reproducible esa revisión: rúbricas ancladas con ejemplos resueltos en cada nivel de puntuación, calibración antes de empezar a puntuar, doble puntuación a ciegas sobre una muestra y arbitraje por escrito cuando los evaluadores discrepan. El resultado es un conjunto de cifras que usted puede defender, junto con el razonamiento que las produjo.

También tratamos la independencia como una restricción de diseño. Los evaluadores de un proyecto no son quienes escribieron sus datos de entrenamiento, porque quien puntúa conforme a su propia directriz tiende a puntuarla con generosidad.

De un vistazo

Tipos de evaluación
Preferencia por pares, puntuación con rúbrica, factualidad y grounding, seguridad y red teaming, creación de conjuntos de referencia.
Puntuado por
Hablantes nativos en Japón; especialistas del ámbito cuando la materia lo exige.
Se comunica con
Acuerdo entre evaluadores, tasa de arbitraje, desglose por criterio y todas las notas de puntuación.
Independencia
Los evaluadores no son los anotadores que escribieron sus datos de entrenamiento.
Repetibilidad
Las rúbricas se versionan, de modo que una ejecución posterior es comparable con una anterior.

Tipos de evaluación

Qué evaluamos

Preguntas distintas requieren instrumentos distintos. La mayoría de los programas aplican dos o tres de estos al mismo modelo.

Preferencia por pares

Dos respuestas al mismo prompt, comparadas conforme a criterios escritos. La forma más robusta de comparar versiones de un modelo, porque un juicio relativo es mucho más estable que una puntuación absoluta.

  • Comparación A/B de modelos
  • Empates registrados de forma explícita
  • Preferencia por criterio
  • Orden controlado para evitar el sesgo de posición

Puntuación con rúbrica

Puntuaciones absolutas sobre criterios nombrados — exactitud, utilidad, registro, formato, seguridad —, cada uno con descripciones ancladas de lo que significa cada puntuación.

  • Escalas ordinales ancladas
  • Puntuaciones por criterio, no una cifra mezclada
  • Justificación obligatoria en las puntuaciones bajas
  • Rúbrica versionada en cada ejecución

Factualidad y grounding

Si una afirmación es cierta y si de verdad la respalda el pasaje que se le dio al modelo. Son dos fallos distintos y se puntúan por separado.

  • Verificación afirmación por afirmación
  • Comprobación de los fragmentos citados
  • Detección de afirmaciones sin respaldo
  • Verificación contra fuentes japonesas

Seguridad y red teaming

Prompts adversarios escritos en japonés por hablantes de japonés, incluidas las formulaciones indirectas y eufemísticas que los conjuntos de prompts traducidos nunca contienen.

  • Conjuntos de ataque por categoría
  • Sondeo del rechazo excesivo
  • Riesgo social y legal propio de Japón
  • Hallazgos etiquetados por gravedad

Creación de conjuntos de referencia

Un conjunto de evaluación reservado y construido para su ámbito, con ítems diseñados para discriminar y no para que todo el mundo los acierte.

  • Bancos de ítems equilibrados por dificultad
  • Obtención de datos atenta a la contaminación
  • Respuestas de referencia con variantes aceptables
  • Harness de puntuación reutilizable

Específico del japonés

Qué se le escapa a una evaluación no japonesa

Cada uno de estos puntos resulta invisible para un modelo juez entrenado en inglés y evidente para un lector japonés.

Adecuación del registro

Una respuesta puede ser gramatical y exacta y seguir estando mal, porque se dirige a un cliente en el registro que usaría con un compañero. En japonés la cortesía es un eje de corrección, no un eje estilístico.

Cómo lo abordamos El registro es un criterio con nombre propio dentro de la rúbrica, con sus propios anclajes, y se puntúa por separado de la exactitud, para que una respuesta bien informada pero mal registrada no pueda esconderse detrás de su contenido.

Intensidad del rechazo

Los rechazos en japonés son indirectos por defecto. Un modelo que responde a una petición prohibida con 難しいかもしれません técnicamente ha esquivado, y muchos sistemas de evaluación puntuarán eso como un rechazo logrado.

Cómo lo abordamos Los rechazos se puntúan según si un hablante de japonés los leería como un rechazo, en una escala con ejemplos resueltos, y el rechazo excesivo se puntúa como un fallo propio y no como un acierto.

Coherencia honorífica entre turnos

La relación establecida al principio de una conversación condiciona todos los turnos posteriores. Los modelos la reinician con frecuencia a mitad del diálogo, lo que un usuario japonés lee como si el asistente olvidara con quién está hablando.

Cómo lo abordamos Los ítems multiturno se puntúan como conversaciones, con un criterio de coherencia que mira a lo largo de los turnos en lugar de a cada respuesta por separado.

Nombres propios y lecturas

Los nombres propios japoneses admiten varias lecturas válidas, y un modelo que produce la lectura equivocada del nombre de una persona o un lugar comete un error factual que ningún corrector ortográfico puede ver.

Cómo lo abordamos Los errores de entidad y de lectura son una subcategoría propia de la factualidad y se verifican contra fuentes japonesas, no contra la memoria de quien evalúa.

Proceso

Cómo se ejecuta una evaluación

La rúbrica es el entregable que sobrevive a la ejecución. Es lo que hace que la próxima evaluación sea comparable con esta.

  1. 01

    Definir qué significa «bueno»

    Convertimos sus preocupaciones de calidad en criterios con nombre y después escribimos descripciones ancladas para cada nivel de puntuación, con ejemplos reales de la salida de su propio modelo.

  2. 02

    Construir el conjunto de ítems

    Los prompts se muestrean o se redactan para cubrir los comportamientos que le importan, incluidos los casos raros y adversarios que un muestreo aleatorio nunca sacaría a la luz.

  3. 03

    Calibrar a los evaluadores

    Todos los evaluadores puntúan el mismo lote de calibración. Se discute la divergencia, se afinan los anclajes de la rúbrica y la puntuación solo empieza cuando el acuerdo es estable.

  4. 04

    Puntuar, revisar por duplicado y arbitrar

    Una proporción definida de ítems la puntúan a ciegas dos evaluadores. Las discrepancias pasan a un revisor sénior que deja constancia del motivo de la resolución.

  5. 05

    Informar con el razonamiento

    Usted recibe las puntuaciones, las estadísticas de acuerdo, el registro de arbitraje y un resumen escrito de los patrones de fallo recurrentes, no solo una fila de un ranking.

Entrega

Qué recibe

Cada puntuación es trazable hasta un ítem, un rol de evaluador, una versión de rúbrica y, cuando se escribió, una justificación.

Entregables de evaluación por defecto. El formato del harness de puntuación se ajusta a su stack cuando ya dispone de uno.
EntregableFormatoContenido
Puntuaciones por ítemJSONL o CSVid del ítem, puntuaciones por criterio, justificación, rol del evaluador, versión de la rúbrica
Informe de acuerdoPDF o Markdownacuerdo entre evaluadores por criterio, tasa de arbitraje, deriva a lo largo de la ejecución
Análisis de fallosPDF o Markdownpatrones recurrentes, ejemplos resueltos, cambios sugeridos en la directriz o en los datos
Hallazgos de red teamingJSONLprompt, respuesta, categoría, gravedad, notas de reproducción
Conjunto de referenciaJSONL más el harnessítems, respuestas de referencia, variantes aceptables, script de puntuación

Calidad

Controles propios de este trabajo

Una evaluación sin estadísticas de acuerdo es una opinión. Estas son las comprobaciones que la convierten en una medición.

  • Ronda de calibración antes de puntuar, repetida cada vez que cambia la rúbrica.
  • Doble puntuación a ciegas sobre una muestra definida, con el acuerdo comunicado por criterio en lugar de mezclado.
  • Arbitraje por escrito de cada discrepancia, conservado como un registro que usted recibe con los resultados.
  • Orden de las respuestas aleatorizado en las comparaciones por pares para controlar el sesgo de posición.
  • Evaluadores separados del equipo que produjo los datos de entrenamiento del mismo proyecto.
  • Versionado de la rúbrica, para que una repetición meses después mida lo mismo que midió antes.

FAQ

Sobre la evaluación de LLM

Lo que preguntan los equipos antes de encargar su primera evaluación en japonés.

Los jueces basados en LLM son baratos, rápidos y útiles para seguir regresiones entre versiones. No son fiables justo donde el japonés es difícil — adecuación de la cortesía, intensidad del rechazo, coherencia honorífica y lectura de los nombres —, porque esos juicios dependen de un conocimiento pragmático nativo. Un planteamiento habitual es un conjunto puntuado por personas como referencia, un juez basado en LLM para las ejecuciones frecuentes y una repuntuación humana periódica que comprueba que el juez no se ha alejado de la referencia.

Depende de qué diferencia necesite detectar y de cuántos criterios esté puntuando. Unos cientos de ítems bien elegidos suelen separar dos modelos claramente distintos; distinguir checkpoints casi equivalentes exige bastantes más. Dimensionamos el conjunto en función de la decisión que quiere tomar, y le diremos cuándo un conjunto es demasiado pequeño para sostener la conclusión que espera de él.

Sí. Para materias como cuestiones jurídicas, fiscales, contables, laborales o de registro de sociedades, formamos el equipo de evaluación en torno a la experiencia que exige la tarea. No mantenemos una bolsa permanente de profesionales titulados: la disponibilidad se valora en cada proyecto en función de su alcance, volumen y calendario, y confirmamos qué es viable antes de empezar el trabajo.

Lo hacemos, pero no con las mismas personas. Los evaluadores de un proyecto están separados de los anotadores que escribieron sus datos de entrenamiento, porque puntuar conforme a una directriz que uno ayudó a redactar no es una medición independiente. Si prefiere que la evaluación quede por completo fuera del proveedor que produjo los datos, nos parece una posición razonable y se lo diremos así.

Los resultados, más el análisis de fallos que los explica. Un informe que solo contiene una puntuación no es accionable: lo que hace falta son los patrones recurrentes que hay detrás, ejemplos resueltos de cada uno y una visión concreta de si la solución pasa por más datos, por una directriz distinta o por un cambio en el producto. Preferimos entregar un hallazgo incómodo con claridad antes que suavizarlo.

Evaluación de LLM

Averigüe en qué se equivoca su modelo en japonés.

Envíenos un conjunto de salidas del modelo o los prompts con los que quiere probarlo. Le devolvemos una rúbrica propuesta, una muestra puntuada con ella y lo que implicaría una ejecución completa.

NDA antes de que comparta ningún dato. La definición del piloto no tiene coste.