LLM e IA generativa

Datos de entrenamiento para LLM en japonés — SFT, preferencia y RLHF

Pares instrucción–respuesta, comparaciones ordenadas, diálogo multiturno y datos de seguridad, escritos por anotadores en Japón conforme a una guía de estilo que su equipo ha aprobado.

Lo difícil de los datos de instrucciones en japonés no es escribir una respuesta. Es escribir la misma respuesta, en el mismo registro, diez mil veces — y poder explicar por escrito por qué se eligió ese registro.

Por qué salen mal los datos de instrucciones en japonés

Los datos de instrucciones escritos por muchas personas se desvían. Un anotador termina todas las respuestas en ですます, otro cambia a である a mitad de una explicación técnica, un tercero escribe con el estilo cortante de un asistente de chat. Un modelo entrenado con esa mezcla aprende que las tres formas son aceptables y luego produce la que le apetece, que es la queja más frecuente que oímos sobre los fine-tunes en japonés.

El registro no es el único eje que se desvía. Los rechazos son peores. El japonés rechaza de forma indirecta, y un anotador al que no se le ha dicho qué aspecto debe tener un rechazo escribirá cualquier cosa, desde un tajante お断りします hasta un suave それは難しいかもしれません. Si la mitad de los datos de seguridad rechaza con tanta suavidad que puede confundirse con una aceptación, el modelo aprende a esquivar en lugar de a rechazar.

Por eso el entregable nunca son solo los datos. Son los datos más las decisiones escritas que los produjeron: la guía de estilo, la plantilla de rechazo, las reglas de formato y la versión de cada una con la que se escribió cada lote.

De un vistazo

Tipos de conjunto de datos
Instrucciones / SFT, pares y ordenaciones de preferencia, diálogo multiturno, datos de seguridad y de rechazo, conjuntos de grounding para RAG.
Redactado por
Anotadores nativos en Japón, revisados por un segundo anotador y por un revisor sénior.
Control del registro
Una guía de estilo escrita fija el nivel de cortesía, las terminaciones de frase, el uso de pronombres y el formato antes de la producción.
Formato habitual
JSONL — arrays de mensajes para SFT, pares chosen/rejected para los datos de preferencia.
Trazabilidad
Cada registro lleva su versión de directriz, el rol de quien lo escribió y su estado de revisión.

Tipos de conjunto de datos

Qué construimos

Cinco familias de conjuntos de datos, que suelen combinarse. Cada una tiene una definición distinta de «correcto», así que cada una recibe su propia sección de directrices y su propia pasada de revisión.

Datos de instrucciones y SFT

Pares prompt–respuesta que demuestran el comportamiento que usted busca, escritos desde cero o reescritos a partir de sus contenidos existentes.

  • Demostraciones de tareas
  • Pares de reescritura y resumen
  • Preguntas y respuestas de dominio
  • Salida con formato restringido

Datos de preferencia y ordenación

Dos o más respuestas candidatas comparadas conforme a criterios escritos, dejando registrado el motivo de la elección en lugar de deducirlo.

  • Pares chosen / rejected
  • Ordenaciones de N alternativas
  • Puntuaciones por criterio
  • Justificación escrita de cada comparación

Diálogo multiturno

Conversaciones en las que el contexto se acumula: el registro fijado en el primer turno tiene que sobrevivir hasta el octavo, que es donde se rompen casi todos los datos de diálogo en japonés.

  • Diálogo orientado a tareas
  • Turnos de aclaración y corrección
  • Comprobación del arrastre de contexto
  • Coherencia de persona y rol

Datos de seguridad, rechazo y red teaming

Prompts que deben rechazarse, prompts que parecen deber rechazarse pero no, y la formulación del rechazo que los separa.

  • Plantillas de rechazo por categoría
  • Contraejemplos de rechazo excesivo
  • Prompts adversarios y de jailbreak
  • Tratamiento de temas sensibles en japonés

Conjuntos de RAG y grounding

Tríadas de pregunta, pasaje recuperado y respuesta fundamentada, más los casos negativos en los que el pasaje no contiene realmente la respuesta.

  • Pares con respuesta / sin respuesta
  • Marcado del fragmento citado
  • Pasajes distractores
  • Grounding sobre documentos japoneses

Específico del japonés

Qué hace que esto sea específico del japonés

Estas son las cuatro decisiones que, si no se toman, producen un conjunto de datos que parece correcto en la revisión y se comporta mal en el modelo.

Registro de cortesía

El japonés obliga a elegir un nivel de cortesía en cada terminación de frase. ですます, である y la forma llana no son intercambiables, y un modelo entrenado con una mezcla las mezclará dentro de una misma respuesta.

Cómo lo abordamos La guía de estilo fija un registro por defecto para cada superficie del producto, enumera las excepciones y ofrece ejemplos resueltos de cada caso. La coherencia de registro es un ítem puntuado en la revisión, no una cuestión de gusto.

Rechazo indirecto

それはちょっと難しいです es un rechazo, no una afirmación sobre la dificultad. Los anotadores que lo etiquetan de forma literal enseñan al modelo a leer una negativa como un comentario neutro.

Cómo lo abordamos Las categorías de rechazo y su formulación se definen de antemano, con la intensidad prevista para cada una. Los datos de seguridad se revisan específicamente para comprobar si un rechazo se lee como un rechazo para un hablante de japonés.

Sujetos omitidos

El japonés omite los sujetos que el contexto hace evidentes. En los datos multiturno el referente puede estar cuatro turnos atrás, y un anotador que escribe una respuesta de forma aislada acabará equivocándose.

Cómo lo abordamos Los ítems multiturno se escriben y se revisan como conversaciones completas, nunca turno a turno. Cuando el referente es realmente ambiguo, la conversación se corrige o se descarta: no se etiqueta a base de suposiciones.

Variación de escritura y formato

Una misma palabra aparece en kanji, hiragana o katakana; las cifras y la puntuación aparecen en ancho completo o medio. Sin control, esto enseña al modelo que el formato es aleatorio.

Cómo lo abordamos Una convención de normalización cubre la elección de escritura para las palabras habituales, los numerales, la puntuación, el espaciado alrededor del texto latino y el formato de las listas. Se aplica al escribir y se comprueba automáticamente antes de la entrega.

Proceso

Cómo se construye un conjunto de datos

El piloto existe para romper el primer borrador de la directriz. La producción solo empieza cuando deja de romperse.

  1. 01

    Definir el comportamiento

    Acordamos qué aspecto tiene una buena respuesta para su producto: registro, extensión, formato, qué rechazar y cómo, y qué debe hacer el modelo cuando no sabe algo.

  2. 02

    Redactar la guía de estilo

    Las decisiones se convierten en un documento escrito con ejemplos y contraejemplos resueltos. Las ambigüedades que usted aún no ha resuelto salen a la luz aquí, en vez de absorberse en silencio.

  3. 03

    Piloto y calibración

    Varios anotadores escriben un lote pequeño de forma independiente. Donde divergen, la directriz no estaba clara: corregimos la directriz, no a los anotadores.

  4. 04

    Redacción y revisión de producción

    Cada ítem lo escribe un anotador y lo revisa otro, con un revisor sénior que muestrea y dirime las discrepancias por escrito.

  5. 05

    Empaquetado y versionado

    La entrega incluye los datos, la versión de la directriz, la trazabilidad por registro, el informe de QA y un registro de cambios respecto al lote anterior.

Entrega

Qué recibe

Los campos se acuerdan en la reunión inicial; esta es la estructura por defecto cuando no hay un esquema previo al que ajustarse.

Estructura de entrega por defecto para los datos de entrenamiento de LLM. Admitimos esquemas propios.
Conjunto de datosFormato por defectoCada registro incluye
Instrucciones / SFTJSONL, array de mensajesturnos system / user / assistant, etiqueta de tarea, versión de la directriz
Pares de preferenciaJSONL, chosen + rejectedambos candidatos, puntuaciones por criterio, justificación escrita
Diálogo multiturnoJSONL, una conversación por línealista completa de turnos, notas de persona, etiqueta de registro
Seguridad y rechazoJSONLprompt, categoría, comportamiento esperado, formulación de rechazo utilizada
Grounding para RAGJSONLpregunta, pasajes, respuesta, fragmentos citados, marca de si tiene respuesta

Calidad

Controles propios de este trabajo

Un QA de anotación genérico no detecta la deriva de registro ni un rechazo demasiado suave. Estas comprobaciones sí.

  • Coherencia de registro puntuada en cada respuesta y a lo largo de todos los turnos de una conversación.
  • Intensidad del rechazo revisada por un segundo hablante nativo conforme a las categorías definidas.
  • Comprobaciones automáticas de normalización de escritura, numerales, puntuación y espaciado antes de la entrega.
  • Detección de duplicados y casi duplicados entre lotes, para que el conjunto no pierda diversidad sin que nadie lo note.
  • Diversidad de prompts controlada frente a la taxonomía de tareas, para que ninguna categoría quede sobrerrepresentada por accidente.
  • Una muestra reservada que un revisor sénior vuelve a revisar a ciegas para obtener la cifra de calidad del lote.

FAQ

Sobre los datos de entrenamiento para LLM

Las preguntas que hacen los equipos cuando acotan su primer fine-tune en japonés.

Ambas cosas. Escribir desde cero es habitual en japonés, porque los datos de instrucciones abiertos y utilizables en japonés escasean y los datos traducidos automáticamente arrastran la estructura sintáctica del inglés hasta el modelo. Cuando usted ya tiene contenido — registros de soporte, manuales, documentos internos —, lo más frecuente es que reescribamos a partir de ahí, lo que ancla los datos en su dominio real.

Con una guía de estilo escrita y ejemplos resueltos, una ronda de calibración previa a la producción en la que varios anotadores escriben los mismos ítems de forma independiente, y la coherencia de registro como ítem puntuado de forma explícita en la revisión. Aquí la coherencia es una propiedad medible, no una aspiración: lo que vigilamos es la divergencia entre anotadores, y cada divergencia resuelta se incorpora a la guía.

No como fuente de los datos finales. Los datos de instrucciones traducidos heredan la estructura discursiva inglesa, los supuestos de cortesía ingleses y los hábitos de formato ingleses, y los modelos entrenados con ellos producen un japonés que los lectores nativos describen como traducido. Sí usamos la traducción como andamiaje para ideas de prompts, pero las respuestas las escriben en japonés hablantes de japonés.

Solo cuando usted lo haya aceptado, y siempre con reescritura y revisión humana encima: nunca como un paso automático sin revisar. Si se ha usado asistencia de IA queda registrado en cada registro, de modo que después pueda filtrarlo o auditarlo. Si necesita datos escritos íntegramente por personas, ejecutamos el proyecto de esa manera y el campo de trazabilidad lo demuestra.

Menos del que espera la mayoría de los equipos. Unos pocos miles de ítems escritos con cuidado y con un registro coherente suelen hacer avanzar un fine-tune en japonés más que diez veces esa cantidad de datos ruidosos, porque el modelo está aprendiendo un estilo tanto como una tarea. Primero acotamos un piloto de unos cientos de ítems para validar la directriz y después dimensionamos la producción a partir de lo que ese piloto mide.

Datos para LLM

Envíenos el comportamiento que quiere enseñar.

Basta con una descripción de la tarea y un puñado de respuestas de ejemplo para empezar. Le devolvemos las preguntas de taxonomía que necesitaríamos resolver y un piloto acotado.

NDA antes de que comparta ningún dato. La definición del piloto no tiene coste.