Données en langue japonaise
Pourquoi les données japonaises sont difficiles pour l’IA
Sept propriétés du japonais qui mettent en défaut les présupposés des chaînes NLP conçues d’abord pour l’anglais — et, pour chacune, la décision que des consignes d’annotation doivent trancher.
Cette page s’adresse à la personne qui doit spécifier un jeu de données japonais et cherche à savoir ce qu’on lui demandera de décider.
Le mode de défaillance est le silence, pas l’erreur
Les jeux de données japonais échouent rarement bruyamment. Ils échouent en contenant deux réponses défendables à la même question, consignées comme si elles n’en faisaient qu’une. Un annotateur écrit un nom d’entreprise avec 株式会社 dans l’empan de l’entité et un autre l’en exclut ; un transcripteur écrit ありがとう et un autre 有難う ; un évaluateur lit それはちょっと難しいです comme un constat de difficulté et un autre comme un refus. Rien dans la chaîne ne proteste. L’incohérence devient simplement une part de ce que le modèle apprend.
C’est pourquoi le travail d’annotation en japonais est dominé par la spécification plutôt que par la main-d’œuvre. Presque toutes les difficultés ci-dessous n’ont pas de résolution unique et correcte — elles ont une résolution qu’il faut choisir, écrire, puis appliquer à l’identique dix mille fois. Une équipe qui opère ces choix explicitement l’emportera sur une équipe plus nombreuse qui ne le fait pas.
Ce qui suit est la liste que nous parcourons au démarrage d’un projet, avec la décision que chaque point impose. Elle est volontairement concrète : ce sont les questions que nous vous poserons réellement.
En bref
- Systèmes d’écriture
- Quatre en usage simultané — kanji, hiragana, katakana et écriture latine — souvent dans une même phrase.
- Frontières de mots
- Aucune. La segmentation est produite par un analyseur morphologique, et les analyseurs ne s’accordent pas.
- Politesse
- Grammaticalement obligatoire. Chaque fin de phrase encode une relation sociale.
- Sujets
- Couramment omis et reconstitués par le contexte, parfois plusieurs phrases plus haut.
- Conséquence pratique
- La plupart des défauts des données japonaises sont des décisions non prises, pas des erreurs d’annotateurs.
Les difficultés
Sept propriétés qui mettent en défaut les présupposés anglophones
Chacune est une propriété de la langue, non une bizarrerie d’un jeu de données. Elles apparaîtront dans tout projet japonais que vous mènerez.
Quatre systèmes d’écriture à la fois
漢字・ひらがな・カタカナ・ローマ字Le même mot peut s’écrire en kanji, en hiragana, en katakana ou en écriture latine, et les quatre peuvent apparaître dans une seule phrase. 卵, たまご et タマゴ sont le même mot avec des connotations différentes ; コンピュータ et コンピューター diffèrent d’un caractère et sont tous deux standard.
Notre approche Une convention de normalisation énumère l’écriture requise pour les mots fréquents, fixe une valeur par défaut pour les autres, et arrête le traitement des voyelles longues ainsi que de la pleine et de la demi-chasse. Tout le reste en découle.
Pas d’espaces entre les mots
分かち書きがないUn texte japonais est une chaîne ininterrompue. Les frontières de mots sont produites par un analyseur morphologique, et MeCab, Sudachi et Juman++ segmentent la même phrase différemment — un empan annoté selon l’un peut donc ne pas s’aligner sur l’autre.
Notre approche Figer l’analyseur et le dictionnaire avant l’annotation, stocker les empans en décalages de caractères pour qu’ils survivent à un changement de tokeniseur, et valider qu’aucun empan ne se termine à l’intérieur d’un token.
Politesse obligatoire
敬語La grammaire japonaise impose un choix de politesse dans presque chaque phrase. 尊敬語 élève l’interlocuteur, 謙譲語 abaisse le locuteur et 丁寧語 est le registre poli neutre ; le choix correct dépend de la relation, non du contenu.
Notre approche Choisir un registre par défaut pour chaque surface produit, énumérer les exceptions et noter le registre comme critère à part entière en relecture, afin qu’une réponse bien informée mais au registre inadapté ne passe pas.
Sujets et objets omis
主語省略・ゼロ代名詞Le japonais omet tout ce que le contexte permet de récupérer. Une réponse rédigée isolément se rattache fréquemment au mauvais référent, et dans un dialogue multi-tours le vrai référent peut se trouver plusieurs tours plus haut.
Notre approche Annoter et relire les conversations comme des ensembles entiers plutôt que tour par tour, et traiter un référent réellement irrécupérable comme un défaut de l’item plutôt que comme quelque chose à deviner.
L’indirection comme grammaire du refus
断りの婉曲表現Un refus s’exprime souvent comme un constat de difficulté ou de circonstance. それはちょっと難しいです décline ; ちょっと考えさせてください décline fréquemment. Une lecture littérale inverse le sens.
Notre approche Définir les catégories de refus et leur force visée avec des exemples travaillés, et noter les refus selon qu’un locuteur japonais les lit comme des refus — et non selon qu’ils contiennent une négation.
Des noms à plusieurs lectures valides
固有名詞の読みUn nom de personne ou de lieu japonais écrit en kanji admet souvent plusieurs lectures possibles, et la bonne est un fait propre à la personne plutôt qu’une règle. 東海林 peut se lire Shoji ou Tokairin ; les deux sont de vrais patronymes.
Notre approche Capter la lecture dans un champ distinct plutôt que de la déduire, la vérifier auprès d’une source, et marquer comme non vérifiée une lecture invérifiable plutôt que de retenir la plus courante.
Des registres de domaine différents du japonais ordinaire
専門用語・文体Le japonais juridique, fiscal, médical et administratif possède son vocabulaire, ses structures de phrase et ses formules consacrées. Un japonais courant et fluide ne suffit pas à juger si une clause contractuelle ou une explication fiscale est correctement formulée.
Notre approche Faire correspondre l’annotateur au registre dans lequel les données sont écrites, et faire intervenir des spécialistes métier lorsque le jugement à porter est professionnel plutôt que linguistique.
Un exemple travaillé
Une phrase, cinq sens
La phrase ci-dessous est ordinaire, polie et extrêmement courante. Celle de ses cinq lectures qui s’applique est entièrement déterminée par la situation qui l’entoure — c’est exactement l’information que des consignes d’annotation doivent fournir.
大丈夫です。
Daijōbu desu.
Une seule phrase, plusieurs sens.
Survolez un sens pour découvrir le contexte qui le détermine.
C’est le même exemple que sur la page d’accueil. Il figure ici parce qu’il illustre le plus clairement pourquoi le contexte, et non le vocabulaire, est la partie difficile de l’annotation en japonais.
Spécification
Décisions qu’il vaut mieux écrire avant de commencer
Chacune d’elles sera sinon tranchée implicitement, et différemment, par chaque personne qui touche aux données.
- L’écriture dans laquelle chaque mot fréquent est transcrit, et la règle par défaut pour les mots absents de la liste.
- Si les chiffres sont arabes ou en kanji, et comment s’écrivent les classificateurs, les dates, les montants et les heures.
- L’analyseur morphologique et le dictionnaire au regard desquels les frontières d’empans sont définies.
- Si les préfixes et suffixes de forme juridique tels que 株式会社 se situent dans ou hors de l’empan d’une organisation.
- La politique d’empan maximal ou minimal pour les noms composés, et les cas où l’imbrication est permise.
- Le registre de politesse par défaut, ses exceptions, et à quoi ressemble un refus correct.
- La normalisation pleine chasse / demi-chasse : ce qui est converti, et ce qui est conservé à l’identique.
- Comment les dates en années d’ère sont consignées, et si une conversion grégorienne est stockée à côté.
- Ce qu’il advient d’un item réellement ambigu — signalé, remonté ou exclu.
Glossaire
Termes qui apparaissent dans les consignes d’annotation japonaises
Le vocabulaire que vous rencontrerez dans une spécification de données japonaises, défini tel qu’il est réellement employé en annotation.
- Keigo 敬語
- Le système d’ensemble du langage honorifique japonais, qui couvre les formes respectueuses, humbles et polies. Son emploi est grammaticalement obligatoire et non facultatif : chaque phrase encode donc une posture sociale.
- Sonkeigo 尊敬語
- Langage respectueux qui élève la personne dont on parle. Employé à propos du client, du donneur d’ordre ou d’un supérieur — jamais à propos de soi-même.
- Kenjougo 謙譲語
- Langage humble qui abaisse le locuteur ou son groupe par rapport à l’interlocuteur. Usuel dans la communication professionnelle japonaise pour décrire ses propres actions.
- Teineigo 丁寧語
- Registre poli simple, marqué principalement par les terminaisons ですます. Valeur par défaut habituelle pour les sorties d’IA destinées au grand public en japonais.
- Wakachigaki 分かち書き
- Écriture avec des espaces insérés entre les mots. Non standard en japonais, raison pour laquelle la segmentation doit être produite par un analyseur morphologique et non lue dans le texte.
- Analyseur morphologique 形態素解析器
- Outil qui segmente un texte japonais en morphèmes et leur attribue des étiquettes de parties du discours. MeCab, Sudachi et Juman++ sont les choix courants, et ils ne s’accordent pas toujours.
- Furigana / ruby ふりがな・ルビ
- Petits kana imprimés au-dessus ou à côté d’un kanji pour en donner la lecture. Il s’agit d’une glose de prononciation et non de contenu : cela demande donc une représentation propre dans un texte annoté.
- Okurigana 送り仮名
- Kana écrits après un kanji pour marquer la flexion. Plusieurs graphies sont souvent admises pour un même mot, ce qui est une source fréquente de variation de surface.
- Hyoukiyure 表記ゆれ
- Variation orthographique — le même mot apparaissant dans des écritures ou des graphies différentes au fil d’un corpus. Le défaut le plus fréquent des jeux de données japonais non spécifiés.
- Zenkaku / hankaku 全角・半角
- Formes de caractères pleine chasse et demi-chasse. A et A sont des caractères différents d’aspect presque identique : la normalisation doit donc être énoncée explicitement.
- Josuushi 助数詞
- Classificateurs attachés aux nombres, qui varient selon le type de chose comptée. Leur lecture est irrégulière, ce qui compte particulièrement pour les données vocales.
- Anaphore zéro ゼロ代名詞
- Sujet ou objet omis qui doit être récupéré à partir du contexte. Omniprésent en japonais et cause fréquente de rattachement au mauvais référent dans un texte généré.
- Kyuujitai 旧字体
- Formes de kanji antérieures à la réforme, encore présentes dans les documents anciens, les registres légaux et certains noms de personnes. Elles doivent être conservées et non normalisées lorsqu’elles identifient une personne ou une entité immatriculée.
- Wareki 和暦
- Dates japonaises fondées sur les ères, comme 令和6年. Courantes sur les documents officiels et les formulaires, et figurant souvent aux côtés de dates grégoriennes sur la même page.
FAQ
À propos des données en langue japonaise
Questions des équipes qui construisent leur premier jeu de données japonais.
Pour des prompts et des idées de tâches, la traduction est un échafaudage raisonnable. Pour des réponses, non : le japonais traduit porte la structure de phrase anglaise, les présupposés de politesse anglais et les habitudes de mise en forme anglaises, et les lecteurs natifs décrivent les modèles entraînés dessus comme sonnant traduits. La traduction ne peut pas non plus produire les phénomènes qui n’existent qu’en japonais — cohérence honorifique, refus indirect, variation d’écriture — c’est-à-dire précisément les comportements que vous cherchez à enseigner.
Pour tout ce qui touche au registre, à la force d’un refus ou au sens pragmatique, le jugement natif n’est pas un luxe. Savoir si それはちょっと難しいです se lit comme un refus est un fait sur la façon dont la phrase est reçue par un auditeur natif, et un non-natif très avancé peut l’analyser correctement tout en se trompant sur la force. Pour des tâches mécaniques avec des consignes bien spécifiées, un niveau avancé suffit souvent.
Il compte dès que les étiquettes sont des empans. Différents analyseurs placent les frontières différemment : un empan annoté selon une segmentation peut tomber à l’intérieur d’un token dans une autre, et l’étiquetage BIO le déplacera silencieusement. Stocker les décalages en caractères à côté du format d’étiquetage est ce qui permet aux données de survivre à un changement ultérieur de tokeniseur sans réannotation.
À l’item, généralement oui — le travail de spécification est plus lourd, le vivier d’annotateurs plus restreint, et davantage de tâches exigent la relecture d’un second locuteur natif. En contrepartie, des données japonaises bien spécifiées vont plus loin à l’item, car une grande partie de ce que le modèle apprend est un style cohérent, et la cohérence s’obtient par la spécification plutôt que par le volume.
Un échantillon de vos données réelles, y compris les parties que vous jugez désordonnées, plus une description de ce que le modèle doit en faire. Cela nous suffit pour rédiger les décisions énumérées ci-dessus, annoter un petit pilote et vous montrer où deux annotateurs raisonnables divergent — c’est le moyen le plus rapide de découvrir ce qui manque à votre spécification.
Données en langue japonaise
Le difficile, c’est la spécification. Commencez par là.
Envoyez un échantillon de données et ce que vous voulez que le modèle fasse. Nous revenons vers vous avec les décisions que vos consignes devront trancher, et un pilote qui les met à l’épreuve.
NDA avant tout partage de données. Le cadrage du pilote est gratuit.