Hueco en la directriz
El caso no está cubierto por la directriz. Se corrige revisando la directriz, no corrigiendo el ítem: de lo contrario, el mismo caso volverá a aparecer.
Marco de calidad
O la calidad es un número sobre el que se puede actuar, o es una opinión. Esta página explica exactamente qué números producimos, cómo se calculan, qué pueden y qué no pueden decirle, y qué llega en el informe de QA con cada lote.
Todas las cifras que aparecen en este sitio como ejemplo están etiquetadas como ejemplo. No publicamos garantías de exactitud, porque una garantía dada antes de ver sus datos no es un compromiso: es una cifra de marketing.
Una inspección final puede detectar errores. No puede detectar la ambigüedad, y la ambigüedad es lo que realmente degrada un conjunto de datos en japonés. Si la directriz permite dos lecturas de un caso, ambas lecturas pasan la inspección, y la incoherencia llega a los datos de entrenamiento con un certificado de buena salud.
Por eso el trabajo que determina la calidad ocurre antes de anotar: escribir la directriz, romperla con casos límite reales durante un piloto, medir si anotadores independientes convergen y corregir la directriz donde no lo hacen. La revisión es la segunda línea de defensa, no la primera.
Lo que sigue es el sistema completo, incluidas las partes que resulta incómodo publicar: qué deja de captar cada métrica y dónde un número puede parecer sano mientras el conjunto de datos no lo está.
De un vistazo
El sistema
Este bucle se ejecuta durante toda la vida del proyecto, no una sola vez al principio.
La directriz se escribe con ejemplos resueltos y contraejemplos para cada decisión que exige la tarea. Todo lo que aquí quede implícito se convierte después en incoherencia.
Los anotadores etiquetan de forma independiente el mismo conjunto de calibración. La divergencia señala dónde la directriz es ambigua: se corrige la directriz, no al anotador.
Trabajo de producción, con la versión de la directriz registrada en cada ítem, de modo que una pregunta posterior sobre un registro pueda responderse con precisión.
Un segundo anotador revisa con la profundidad que la tarea merece. La revisión es un rol distinto con sus propios criterios, no una repetición más rápida de la anotación.
Las discrepancias pasan a un revisor sénior, que deja constancia de la resolución y de su motivo. Cada resolución se convierte en un ejemplo resuelto dentro de la directriz.
El acuerdo, la precisión sobre el gold set y la deriva se calculan por lote, se comparan con los lotes anteriores y sirven para decidir dónde hace falta la siguiente revisión de la directriz.
Métricas
Se definen aquí para que una cifra de un informe de QA se pueda interpretar sin tener que preguntarnos a qué se refiere.
Acuerdo entre anotadores
97.8%
2.1% frente a los últimos 7 días
Precisión sobre gold set
98.6%
1.4% frente a los últimos 7 días
Ítems revisados
24826
18.7% esta semana
Discrepancias abiertas
18
12 frente a los últimos 7 días
Interfaz ilustrativa. Las cifras mostradas son datos de muestra que sirven para explicar cómo controlamos la calidad, no resultados declarados.
Revisión
La profundidad de revisión es un ajuste del proyecto, acordado con usted y recogido en el contrato. Más profunda no siempre es mejor: una tarea mecánica revisada a fondo gasta presupuesto donde no hace falta ningún criterio.
| Profundidad de revisión | Se usa habitualmente para | Qué ocurre |
|---|---|---|
| Revisión por muestreo | Tareas mecánicas de gran volumen con un acuerdo estable | Se revisa una proporción definida de ítems; los fallos activan una pasada más amplia |
| Segunda pasada completa | Etiquetado que depende del criterio y la mayor parte del trabajo de tramos en japonés | Un segundo anotador revisa todos los ítems |
| Doble anotación a ciegas | Conjuntos de evaluación, benchmarks y gold sets | Dos anotadores trabajan de forma independiente; todas las discrepancias se arbitran |
| Revisión experta | Ámbitos regulados y criterio profesional | Revisa un especialista del ámbito, con razonamiento escrito en los ítems controvertidos |
Taxonomía de errores
Un defecto que tiene nombre se puede contar, seguir en el tiempo y corregir. Un recuento genérico de «errores» no le dice qué cambiar.
El caso no está cubierto por la directriz. Se corrige revisando la directriz, no corrigiendo el ítem: de lo contrario, el mismo caso volverá a aparecer.
El caso sí está cubierto y el anotador aplicó mal la regla. Se corrige con retroalimentación y, si se repite, con un ejemplo resuelto más claro.
La etiqueta es correcta y el tramo no. Es propio del trabajo de tramos en japonés, donde interactúan las reglas de límites y la tokenización.
Lingüísticamente correcto y socialmente equivocado: el nivel de cortesía inadecuado, o un rechazo demasiado suave para leerse como tal.
Una afirmación verificable, la lectura de un nombre o una cifra están mal. Se distingue de los errores de criterio porque la solución es la verificación, no la calibración.
El propio ítem es inservible: audio inaudible, un escaneo ilegible, un prompt ambiguo. Se marca y se devuelve, nunca se rellena con una suposición verosímil.
Informes
El informe está pensado para que usted pueda auditar el lote sin nosotros delante.
FAQ
Preguntas sobre qué demuestran y qué no demuestran estos números.
No publicamos ninguna garantía de exactitud, y trataríamos con cautela la de cualquier proveedor. La exactitud alcanzable depende de la tarea, de la taxonomía, de la calidad de los datos de origen y de cuánta ambigüedad real contiene el ámbito, y nada de eso se conoce antes de un piloto. A lo que sí nos comprometemos es al método de medición: qué métricas, calculadas cómo, comunicadas con qué frecuencia y qué ocurre cuando un lote se queda corto. Después de un piloto sobre sus datos podemos hablar de objetivos realistas, porque para entonces habrá algo real de lo que hablar.
Son datos de muestra. Existen para mostrar qué comunica la interfaz y qué aspecto tienen las métricas en movimiento, y por eso mismo llevan una insignia y una advertencia visibles. No son resultados de un proyecto de cliente y no los presentaremos como tales.
Por sí solo, no. El acuerdo mide la coherencia, no la corrección: los anotadores que comparten el mismo malentendido coinciden a la perfección. También lo inflan las taxonomías desequilibradas, y por eso comunicamos un coeficiente corregido por azar junto al acuerdo bruto, y por eso existen los gold sets arbitrados por revisores sénior como comprobación independiente de la corrección.
No se entrega. Según el fallo, la respuesta es una reanotación selectiva, una revisión de la directriz seguida de rehacer los ítems afectados, o una escalada hasta usted cuando la causa está aguas arriba: una taxonomía ambigua o unos datos de origen que no pueden sostener la tarea. Preferimos entregar tarde con una explicación que a tiempo con una cifra que no sobrevivirá al contacto con su modelo.
Sí, y es razonable pedirlo. Puede revisar la directriz y su historial de versiones, tomar una muestra para puntuarla de forma independiente y comparar sus resultados con las cifras que comunicamos. Cuando un cliente ejecuta su propio QA en paralelo, tratamos la divergencia entre ambos como un hallazgo que merece investigarse y no como una disputa que haya que ganar.
Calidad
Un piloto produce cifras de acuerdo reales, un desglose real de errores y una visión honesta de qué partes de su taxonomía aguantarán a volumen.
NDA antes de que comparta ningún dato. La definición del piloto no tiene coste.