Marco de calidad

Cómo medimos la calidad de la anotación

O la calidad es un número sobre el que se puede actuar, o es una opinión. Esta página explica exactamente qué números producimos, cómo se calculan, qué pueden y qué no pueden decirle, y qué llega en el informe de QA con cada lote.

Todas las cifras que aparecen en este sitio como ejemplo están etiquetadas como ejemplo. No publicamos garantías de exactitud, porque una garantía dada antes de ver sus datos no es un compromiso: es una cifra de marketing.

La calidad se diseña, no se inspecciona

Una inspección final puede detectar errores. No puede detectar la ambigüedad, y la ambigüedad es lo que realmente degrada un conjunto de datos en japonés. Si la directriz permite dos lecturas de un caso, ambas lecturas pasan la inspección, y la incoherencia llega a los datos de entrenamiento con un certificado de buena salud.

Por eso el trabajo que determina la calidad ocurre antes de anotar: escribir la directriz, romperla con casos límite reales durante un piloto, medir si anotadores independientes convergen y corregir la directriz donde no lo hacen. La revisión es la segunda línea de defensa, no la primera.

Lo que sigue es el sistema completo, incluidas las partes que resulta incómodo publicar: qué deja de captar cada métrica y dónde un número puede parecer sano mientras el conjunto de datos no lo está.

De un vistazo

Qué medimos
Acuerdo entre anotadores, precisión medida sobre el gold set, tasa de arbitraje y deriva de etiquetas.
Cómo se comunica
Por lote, con desglose por etiqueta y por criterio en lugar de una única cifra mezclada.
Profundidad de revisión
Se fija en cada proyecto. Más profunda donde hace falta criterio, más ligera donde la tarea es mecánica.
Discrepancias
Las dirime por escrito un revisor sénior y se incorporan a la directriz.
Lo que no hacemos
Publicar garantías de exactitud ni citar una cifra medida en otro proyecto.

El sistema

Seis etapas que funcionan de forma continua

Este bucle se ejecuta durante toda la vida del proyecto, no una sola vez al principio.

  1. 01

    Especificar

    La directriz se escribe con ejemplos resueltos y contraejemplos para cada decisión que exige la tarea. Todo lo que aquí quede implícito se convierte después en incoherencia.

  2. 02

    Calibrar

    Los anotadores etiquetan de forma independiente el mismo conjunto de calibración. La divergencia señala dónde la directriz es ambigua: se corrige la directriz, no al anotador.

  3. 03

    Anotar

    Trabajo de producción, con la versión de la directriz registrada en cada ítem, de modo que una pregunta posterior sobre un registro pueda responderse con precisión.

  4. 04

    Revisar

    Un segundo anotador revisa con la profundidad que la tarea merece. La revisión es un rol distinto con sus propios criterios, no una repetición más rápida de la anotación.

  5. 05

    Arbitrar

    Las discrepancias pasan a un revisor sénior, que deja constancia de la resolución y de su motivo. Cada resolución se convierte en un ejemplo resuelto dentro de la directriz.

  6. 06

    Medir y retroalimentar

    El acuerdo, la precisión sobre el gold set y la deriva se calculan por lote, se comparan con los lotes anteriores y sirven para decidir dónde hace falta la siguiente revisión de la directriz.

Métricas

Qué significa realmente cada número

Se definen aquí para que una cifra de un informe de QA se pueda interpretar sin tener que preguntarnos a qué se refiere.

Acuerdo entre anotadores
Con qué frecuencia anotadores independientes producen la misma etiqueta sobre el mismo ítem. Se comunica como acuerdo bruto junto con un coeficiente corregido por azar, porque el acuerdo bruto sobre una taxonomía desequilibrada puede parecer excelente sin apenas aportar información.
κ de Cohen / α de Krippendorff
Coeficientes de acuerdo corregidos por azar. La κ de Cohen para dos anotadores sobre etiquetas categóricas; la α de Krippendorff cuando hay más de dos anotadores, juicios ausentes o escalas ordinales. Cuál se ha utilizado se indica en el informe en lugar de dejarse implícito.
Precisión sobre el gold set
Precisión frente a un conjunto de referencia anotado y arbitrado por revisores sénior. Mide la corrección, no la coherencia: dos anotadores pueden coincidir a la perfección y equivocarse los dos, algo que las estadísticas de acuerdo por sí solas nunca revelarán.
Tasa de arbitraje
La proporción de ítems que requirieron la intervención de un revisor sénior. Una tasa de arbitraje al alza suele ser la señal más temprana de que los datos han cambiado o de que la directriz tiene un hueco, y se mueve antes que la precisión.
Deriva de etiquetas
Movimiento en la distribución de etiquetas o en el comportamiento de los anotadores a lo largo del tiempo. Los proyectos largos derivan por motivos corrientes — los datos de origen cambian, los anotadores ganan confianza — y la monitorización de la deriva es lo que distingue eso de una degradación real.
Acuerdo de límites
En las tareas de tramos, hasta qué punto los anotadores coinciden en dónde empieza y termina un tramo, comunicado por separado de si coinciden en su etiqueta. Un conjunto de datos de tramos en japonés puede tener un acuerdo de etiquetas excelente y unos límites inservibles.

Visión general de la calidad

Panel de QA de ejemplo

Acuerdo entre anotadores

97.8%

2.1% frente a los últimos 7 días

Precisión sobre gold set

98.6%

1.4% frente a los últimos 7 días

Ítems revisados

24826

18.7% esta semana

Discrepancias abiertas

18

12 frente a los últimos 7 días

Deriva de etiquetas (30 días)

Deriva observada Umbral de alerta
0%2.5%5% Day 1Day 8Day 15Day 22Day 30

Resumen de calidad

  • Cumplimiento de las directrices
  • Calibración de revisores
  • Monitorización de valores atípicos
  • Detección de deriva

Interfaz ilustrativa. Las cifras mostradas son datos de muestra que sirven para explicar cómo controlamos la calidad, no resultados declarados.

Revisión

Qué parte de un lote se revisa

La profundidad de revisión es un ajuste del proyecto, acordado con usted y recogido en el contrato. Más profunda no siempre es mejor: una tarea mecánica revisada a fondo gasta presupuesto donde no hace falta ningún criterio.

Configuraciones de revisión ilustrativas. La profundidad real de un proyecto se acuerda durante la definición del alcance.
Profundidad de revisiónSe usa habitualmente paraQué ocurre
Revisión por muestreoTareas mecánicas de gran volumen con un acuerdo estableSe revisa una proporción definida de ítems; los fallos activan una pasada más amplia
Segunda pasada completaEtiquetado que depende del criterio y la mayor parte del trabajo de tramos en japonésUn segundo anotador revisa todos los ítems
Doble anotación a ciegasConjuntos de evaluación, benchmarks y gold setsDos anotadores trabajan de forma independiente; todas las discrepancias se arbitran
Revisión expertaÁmbitos regulados y criterio profesionalRevisa un especialista del ámbito, con razonamiento escrito en los ítems controvertidos

Taxonomía de errores

Poner nombre a los fallos

Un defecto que tiene nombre se puede contar, seguir en el tiempo y corregir. Un recuento genérico de «errores» no le dice qué cambiar.

Hueco en la directriz

El caso no está cubierto por la directriz. Se corrige revisando la directriz, no corrigiendo el ítem: de lo contrario, el mismo caso volverá a aparecer.

Aplicación incorrecta de la directriz

El caso sí está cubierto y el anotador aplicó mal la regla. Se corrige con retroalimentación y, si se repite, con un ejemplo resuelto más claro.

Error de límites

La etiqueta es correcta y el tramo no. Es propio del trabajo de tramos en japonés, donde interactúan las reglas de límites y la tokenización.

Error de registro o de matiz

Lingüísticamente correcto y socialmente equivocado: el nivel de cortesía inadecuado, o un rechazo demasiado suave para leerse como tal.

Error factual

Una afirmación verificable, la lectura de un nombre o una cifra están mal. Se distingue de los errores de criterio porque la solución es la verificación, no la calibración.

Defecto de origen

El propio ítem es inservible: audio inaudible, un escaneo ilegible, un prompt ambiguo. Se marca y se devuelve, nunca se rellena con una suposición verosímil.

Informes

Qué llega con cada lote

El informe está pensado para que usted pueda auditar el lote sin nosotros delante.

  • Cifras de acuerdo por etiqueta o por criterio, indicando de forma explícita el coeficiente utilizado.
  • Precisión sobre el gold set del lote y su evolución respecto a los lotes anteriores.
  • Tasa de arbitraje, con el registro de arbitraje y el razonamiento anotado en cada resolución.
  • Recuentos de errores desglosados según la taxonomía anterior, en lugar de un único total de defectos.
  • La versión de la directriz con la que se anotó el lote y un registro de cambios respecto a la versión anterior.
  • Los ítems marcados como defectos de origen, enumerados en lugar de descartados en silencio.

FAQ

Sobre la medición de la calidad

Preguntas sobre qué demuestran y qué no demuestran estos números.

No publicamos ninguna garantía de exactitud, y trataríamos con cautela la de cualquier proveedor. La exactitud alcanzable depende de la tarea, de la taxonomía, de la calidad de los datos de origen y de cuánta ambigüedad real contiene el ámbito, y nada de eso se conoce antes de un piloto. A lo que sí nos comprometemos es al método de medición: qué métricas, calculadas cómo, comunicadas con qué frecuencia y qué ocurre cuando un lote se queda corto. Después de un piloto sobre sus datos podemos hablar de objetivos realistas, porque para entonces habrá algo real de lo que hablar.

Son datos de muestra. Existen para mostrar qué comunica la interfaz y qué aspecto tienen las métricas en movimiento, y por eso mismo llevan una insignia y una advertencia visibles. No son resultados de un proyecto de cliente y no los presentaremos como tales.

Por sí solo, no. El acuerdo mide la coherencia, no la corrección: los anotadores que comparten el mismo malentendido coinciden a la perfección. También lo inflan las taxonomías desequilibradas, y por eso comunicamos un coeficiente corregido por azar junto al acuerdo bruto, y por eso existen los gold sets arbitrados por revisores sénior como comprobación independiente de la corrección.

No se entrega. Según el fallo, la respuesta es una reanotación selectiva, una revisión de la directriz seguida de rehacer los ítems afectados, o una escalada hasta usted cuando la causa está aguas arriba: una taxonomía ambigua o unos datos de origen que no pueden sostener la tarea. Preferimos entregar tarde con una explicación que a tiempo con una cifra que no sobrevivirá al contacto con su modelo.

Sí, y es razonable pedirlo. Puede revisar la directriz y su historial de versiones, tomar una muestra para puntuarla de forma independiente y comparar sus resultados con las cifras que comunicamos. Cuando un cliente ejecuta su propio QA en paralelo, tratamos la divergencia entre ambos como un hallazgo que merece investigarse y no como una disputa que haya que ganar.

Calidad

Pídanos los números sobre sus propios datos.

Un piloto produce cifras de acuerdo reales, un desglose real de errores y una visión honesta de qué partes de su taxonomía aguantarán a volumen.

NDA antes de que comparta ningún dato. La definición del piloto no tiene coste.