Datos en lengua japonesa
Por qué los datos en japonés son difíciles para la IA
Siete propiedades del japonés que rompen los supuestos incorporados en los pipelines de NLP pensados primero para el inglés y, para cada una, la decisión que una directriz de anotación tiene que tomar al respecto.
Esta página está escrita para quien tiene que especificar un conjunto de datos en japonés y está intentando averiguar qué le van a pedir que decida.
El modo de fallo es el silencio, no el error
Los conjuntos de datos en japonés rara vez fallan de forma ruidosa. Fallan porque contienen dos respuestas defendibles a la misma pregunta, registradas como si fueran la misma respuesta. Un anotador escribe el nombre de una empresa con 株式会社 dentro del tramo de la entidad y otro lo deja fuera; un transcriptor escribe ありがとう y otro 有難う; un evaluador lee それはちょっと難しいです como una afirmación sobre la dificultad y otro como un rechazo. Nada en el pipeline protesta. La incoherencia pasa sin más a formar parte de lo que aprende el modelo.
Por eso el trabajo de anotación en japonés está dominado por la especificación más que por la mano de obra. Casi todas las dificultades que siguen no tienen una resolución correcta única: tienen una resolución que hay que elegir, poner por escrito y después aplicar de forma idéntica diez mil veces. Un equipo que tome esas decisiones de forma explícita superará a un equipo mayor que no lo haga.
Lo que sigue es la lista que recorremos al principio de un proyecto, junto con la decisión que impone cada punto. Es deliberadamente concreta: estas son las preguntas que le haremos de verdad.
De un vistazo
- Sistemas de escritura
- Cuatro en uso simultáneo — kanji, hiragana, katakana y alfabeto latino —, a menudo dentro de una misma frase.
- Límites de palabra
- Ninguno. La segmentación la produce un analizador morfológico, y los analizadores no coinciden entre sí.
- Cortesía
- Gramaticalmente obligatoria. Cada terminación de frase codifica una relación social.
- Sujetos
- Se omiten de forma habitual y se recuperan del contexto, a veces varias frases atrás.
- Consecuencia práctica
- La mayoría de los defectos de los datos en japonés son decisiones no tomadas, no errores de los anotadores.
Las dificultades
Siete propiedades que rompen los supuestos del inglés
Cada una es una propiedad del idioma, no una peculiaridad de un conjunto de datos. Aparecerán en cualquier proyecto japonés que emprenda.
Cuatro sistemas de escritura a la vez
漢字・ひらがな・カタカナ・ローマ字Una misma palabra puede escribirse en kanji, hiragana, katakana o alfabeto latino, y las cuatro formas pueden aparecer en una misma frase. 卵, たまご y タマゴ son la misma palabra con connotaciones distintas; コンピュータ y コンピューター se diferencian en un carácter y ambas son estándar.
Cómo lo abordamos Una convención de normalización enumera la escritura obligatoria de las palabras frecuentes, fija una regla por defecto para el resto y determina el tratamiento de las vocales largas y del ancho completo o medio. Todo lo demás se hereda de ese documento.
Sin espacios entre palabras
分かち書きがないEl texto japonés es una cadena continua. Los límites de palabra los produce un analizador morfológico, y MeCab, Sudachi y Juman++ segmentan la misma frase de forma distinta, así que un tramo anotado contra uno puede no encajar con otro.
Cómo lo abordamos Fije el analizador y el diccionario antes de anotar, guarde los tramos como desplazamientos de carácter para que sobrevivan a un cambio de tokenizador y valide que ningún tramo termina dentro de un token.
Cortesía obligatoria
敬語La gramática japonesa obliga a elegir un nivel de cortesía en casi todas las frases. El 尊敬語 eleva a la otra parte, el 謙譲語 rebaja al hablante y el 丁寧語 es el registro cortés neutro; la elección correcta depende de la relación, no del contenido.
Cómo lo abordamos Elija un registro por defecto para cada superficie del producto, enumere las excepciones y puntúe el registro como criterio propio en la revisión, para que una respuesta bien informada pero mal registrada no pueda pasar.
Sujetos y objetos omitidos
主語省略・ゼロ代名詞El japonés omite todo lo que el contexto permite recuperar. Una respuesta escrita de forma aislada se engancha con frecuencia al referente equivocado, y en el diálogo multiturno el referente real puede estar varios turnos atrás.
Cómo lo abordamos Anote y revise las conversaciones como unidades completas y no turno a turno, y trate un referente realmente irrecuperable como un defecto del ítem en lugar de como algo que hay que adivinar.
La indirección como gramática del rechazo
断りの婉曲表現Un rechazo se expresa a menudo como una afirmación sobre la dificultad o las circunstancias. それはちょっと難しいです es una negativa; ちょっと考えさせてください lo es con frecuencia. Una lectura literal invierte el significado.
Cómo lo abordamos Defina las categorías de rechazo y su intensidad prevista con ejemplos resueltos, y puntúe los rechazos según si un hablante de japonés los lee como rechazos, no según si contienen una negación.
Nombres con varias lecturas válidas
固有名詞の読みUn nombre propio de persona o de lugar escrito en kanji admite a menudo varias lecturas posibles, y la correcta es un hecho sobre esa persona concreta, no una regla. 東海林 puede ser Shoji o Tokairin; ambos son apellidos reales.
Cómo lo abordamos Recoja la lectura como un campo aparte en lugar de deducirla, verifíquela contra una fuente y marque como no verificada la lectura que no se pueda verificar, en vez de elegir la más frecuente.
Registros de dominio distintos del japonés corriente
専門用語・文体El japonés jurídico, fiscal, médico y administrativo tiene su propio vocabulario, sus estructuras oracionales y sus formulaciones convencionales. Un japonés cotidiano fluido no basta para juzgar si una cláusula contractual o una explicación fiscal está correctamente redactada.
Cómo lo abordamos Ajuste el anotador al registro en el que están escritos los datos e incorpore especialistas del ámbito cuando el juicio que hay que emitir sea profesional y no lingüístico.
Un ejemplo resuelto
Una frase, cinco significados
La frase de abajo es corriente, cortés y extremadamente frecuente. Cuál de sus cinco lecturas se aplica lo determina por completo la situación que la rodea, que es justo la información que una directriz de anotación tiene que aportar.
大丈夫です。
Daijōbu desu.
Varios significados, una sola frase.
Pase el cursor sobre un significado para ver el contexto que lo determina.
Es el mismo ejemplo que aparece en la página de inicio. Está aquí porque es la ilustración más clara de por qué el contexto, y no el vocabulario, es la parte difícil de la anotación en japonés.
Especificación
Decisiones que conviene escribir antes de empezar
De lo contrario, cada una de ellas la decidirá de forma implícita, y distinta, cada persona que toque los datos.
- En qué escritura se escribe cada palabra frecuente, y la regla por defecto para las palabras que no están en la lista.
- Si los numerales van en cifras arábigas o en kanji, y cómo se escriben los clasificadores, las fechas, los importes y las horas.
- El analizador morfológico y el diccionario contra los que se definen los límites de los tramos.
- Si los prefijos y sufijos de forma jurídica como 株式会社 quedan dentro o fuera del tramo de la organización.
- La política de tramo máximo o mínimo para los sustantivos compuestos, y dónde se permite el anidamiento.
- El registro de cortesía por defecto, sus excepciones y qué aspecto tiene un rechazo correcto.
- La normalización de ancho completo y ancho medio: qué se convierte y qué se conserva tal cual.
- Cómo se registran las fechas basadas en la era, y si se guarda junto a ellas una conversión gregoriana.
- Qué ocurre con un ítem realmente ambiguo: se marca, se escala o se excluye.
Glosario
Términos que aparecen en las directrices de anotación en japonés
El vocabulario con el que se encontrará en una especificación de datos japoneses, definido tal como se usa realmente en el trabajo de anotación.
- Keigo 敬語
- El sistema general del lenguaje honorífico japonés, que abarca las formas respetuosas, humildes y corteses. Su uso es gramaticalmente obligatorio y no opcional, de modo que cada frase codifica una posición social.
- Sonkeigo 尊敬語
- Lenguaje respetuoso que eleva a la persona de la que se habla. Se usa referido al cliente o a un superior, nunca referido a uno mismo.
- Kenjougo 謙譲語
- Lenguaje humilde que rebaja al hablante o a su grupo frente al interlocutor. Es lo habitual en la comunicación empresarial japonesa al describir las acciones propias.
- Teineigo 丁寧語
- Registro cortés llano, marcado sobre todo por las terminaciones ですます. Es el valor por defecto habitual para la salida de IA dirigida al consumidor en japonés.
- Wakachigaki 分かち書き
- Escritura con espacios insertados entre las palabras. No es estándar en japonés, y por eso la segmentación debe producirla un analizador morfológico en lugar de leerse del propio texto.
- Analizador morfológico 形態素解析器
- Una herramienta que segmenta el texto japonés en morfemas y les asigna categorías gramaticales. MeCab, Sudachi y Juman++ son las opciones habituales, y no siempre coinciden.
- Furigana / ruby ふりがな・ルビ
- Kana pequeños impresos encima o al lado de un kanji para indicar su lectura. Son una glosa de pronunciación y no contenido, así que necesitan su propia representación en el texto anotado.
- Okurigana 送り仮名
- Kana escritos después de un kanji para mostrar la flexión. A menudo se admiten varias grafías para la misma palabra, lo que es una fuente frecuente de variación superficial.
- Hyoukiyure 表記ゆれ
- Variación ortográfica: la misma palabra aparece en distintas escrituras o grafías a lo largo de un corpus. Es el defecto más común en los conjuntos de datos japoneses sin especificar.
- Zenkaku / hankaku 全角・半角
- Formas de carácter de ancho completo y de ancho medio. A y A son caracteres distintos de aspecto casi idéntico, así que la normalización tiene que enunciarse de forma explícita.
- Josuushi 助数詞
- Clasificadores que acompañan a los números y cambian según el tipo de cosa que se cuenta. Su lectura es irregular, lo que importa especialmente en los datos de voz.
- Anáfora cero ゼロ代名詞
- Un sujeto u objeto omitido que debe recuperarse del contexto. Es omnipresente en japonés y una causa frecuente de que el texto generado se enganche al referente equivocado.
- Kyuujitai 旧字体
- Formas de kanji anteriores a la reforma, que aún se encuentran en documentos antiguos, registros legales y algunos nombres de persona. Deben conservarse en lugar de normalizarse cuando identifican a una persona o a una entidad registrada.
- Wareki 和暦
- Fechas japonesas basadas en la era, como 令和6年. Son habituales en documentos oficiales y formularios, y aparecen con frecuencia junto a fechas gregorianas en la misma página.
FAQ
Sobre los datos en lengua japonesa
Preguntas de equipos que construyen su primer conjunto de datos en japonés.
Para los prompts y las ideas de tareas, la traducción es un andamiaje razonable. Para las respuestas no lo es: el japonés traducido arrastra la estructura oracional inglesa, los supuestos de cortesía ingleses y los hábitos de formato ingleses, y los lectores nativos dicen que los modelos entrenados con él suenan a traducción. La traducción tampoco puede producir los fenómenos que solo existen en japonés — coherencia honorífica, rechazo indirecto, variación de escritura —, que son justamente los comportamientos que usted intenta enseñar.
Para todo lo que implique registro, intensidad del rechazo o significado pragmático, el criterio nativo no es un lujo. Que それはちょっと難しいです se lea como una negativa es un hecho sobre cómo cae la frase en un oyente nativo, y un hablante no nativo muy avanzado puede analizarla correctamente y aun así equivocarse en la intensidad. Para tareas mecánicas con una directriz bien especificada, un nivel avanzado suele bastar.
Importa siempre que las etiquetas sean tramos. Cada analizador coloca los límites en un sitio distinto, así que un tramo anotado contra una segmentación puede caer dentro de un token bajo otra, y el etiquetado BIO lo desplazará sin avisar. Guardar los desplazamientos de carácter junto al formato de etiquetas es lo que permite que los datos sobrevivan a un cambio posterior de tokenizador sin reanotarlos.
Por ítem, normalmente sí: el trabajo de especificación es mayor, la bolsa de anotadores es más pequeña y más tareas exigen la revisión de un segundo hablante nativo. El factor que lo compensa es que unos datos japoneses bien especificados rinden más por ítem, porque buena parte de lo que aprende el modelo es un estilo coherente, y la coherencia se consigue mediante especificación, no mediante volumen.
Una muestra de sus datos reales, incluidas las partes que considere desordenadas, más una descripción de qué debe hacer el modelo con ellas. Con eso nos basta para redactar las decisiones enumeradas más arriba, anotar un piloto pequeño y mostrarle dónde discrepan dos anotadores razonables, que es la forma más rápida de descubrir qué le falta a su especificación.
Datos en lengua japonesa
La parte difícil es la especificación. Empiece por ahí.
Envíenos una muestra de datos y qué quiere que haga el modelo. Le devolvemos las decisiones que tendrá que tomar su directriz y un piloto que las pone a prueba.
NDA antes de que comparta ningún dato. La definición del piloto no tiene coste.