NLP japonais

Annotation NLP japonaise — entités, relations et classification

Reconnaissance d’entités nommées, extraction de relations, classification d’intentions et de thèmes, sentiment, inférence en langue naturelle et segmentation — annotés avec le tokeniseur que votre chaîne utilise réellement.

Le japonais n’a pas d’espaces entre les mots. Toute annotation par empans dépend donc d’une décision de frontière que quelqu’un doit prendre, et cette décision doit correspondre au tokeniseur en aval, faute de quoi les étiquettes ne s’aligneront pas.

Tout le problème tient aux frontières

En anglais, « Toyota Motor Corporation » compte trois tokens évidents et la seule question est de savoir où l’entité commence et s’arrête. En japonais, 株式会社トヨタ自動車 est une chaîne ininterrompue, et au moins quatre annotations défendables existent : avec ou sans 株式会社, avec ou sans 自動車, en traitant l’ensemble comme une seule entité, ou en imbriquant une entité plus courte dans une plus longue.

Chacune de ces options est un choix légitime. Ce qui importe, c’est que le même choix soit fait à chaque fois, qu’il soit écrit, et qu’il survive au contact du tokeniseur employé par votre modèle — car une frontière d’empan qui tombe au milieu d’un token ne peut pas être représentée en étiquetage BIO sans se déplacer silencieusement.

C’est pourquoi nous figeons le tokeniseur et les règles de frontière avant le début de l’annotation, et pourquoi nous annotons des décalages en caractères sous le format d’étiquetage de votre choix, afin que les données puissent être retokenisées plus tard sans être réannotées.

En bref

Types de tâches
NER, extraction de relations et d’événements, classification d’intentions et de thèmes, sentiment et émotion, NLI et paraphrase, segmentation et normalisation.
Adapté au tokeniseur
Empans annotés selon MeCab, Sudachi, Juman++ ou le tokeniseur de votre propre modèle, selon ce qui est convenu au lancement.
Règles de frontière
Suffixes de forme juridique, noms composés, préfixes honorifiques et flexions sont tous couverts par des règles écrites.
Sortie habituelle
JSONL avec décalages en caractères ; CoNLL-U, étiquetage BIO et standoff brat également pris en charge.
Relecture
Frontières d’empans et étiquettes d’empans relues comme deux critères distincts.

Types de tâches

Ce que nous annotons

Les tâches sur empans et les tâches sur documents ont des modes de défaillance différents, elles reçoivent donc des critères de relecture différents.

Reconnaissance d’entités nommées

Empans d’entités selon une taxonomie définie pour votre domaine, y compris les entités imbriquées et chevauchantes lorsque vous en avez besoin.

  • Types standard et propres au domaine
  • Empans imbriqués et discontinus
  • Normalisation vers des formes canoniques
  • Rattachement des lectures et des variantes

Extraction de relations et d’événements

Comment les entités se relient — qui a fait quoi à qui, quelle valeur appartient à quel champ, quelle proposition modifie quel terme.

  • Relations binaires et n-aires
  • Déclencheurs et arguments d’événements
  • Relations inter-phrases
  • Marquage de la négation et de l’incertitude

Classification

Intention, thème, catégorie de routage ou étiquette de politique, au niveau de l’énoncé ou du document, mono- ou multi-étiquette.

  • Intention et acte de dialogue
  • Thèmes et catégories de routage
  • Taxonomies multi-étiquettes
  • Traitement du hors périmètre et de l’incertain

Sentiment et émotion

Polarité et émotion au niveau du document, de la phrase ou de l’aspect — ce dernier niveau étant celui dont le texte commercial japonais a réellement besoin.

  • Polarité au document et à la phrase
  • Sentiment par aspect
  • Catégories d’émotions
  • Marquage de la politesse et du registre

Inférence et similarité

Paires d’implication, de paraphrase et de similarité sémantique, plus les négatifs difficiles qui rendent un jeu d’évaluation discriminant.

  • Paires d’implication NLI
  • Identification de paraphrases
  • Scores de similarité gradués
  • Construction de négatifs difficiles

Spécificités japonaises

Les règles que doivent contenir des consignes japonaises

Ces quatre questions surgissent dans la première heure de tout projet japonais d’annotation par empans.

Frontières de mots

Le japonais s’écrit sans espaces : une frontière d’empan relève donc d’un jugement et non d’une simple consultation. Différents analyseurs morphologiques segmentent la même phrase différemment, et des étiquettes alignées sur l’un ne s’aligneront pas sur l’autre.

Notre approche L’analyseur et le dictionnaire sont figés au lancement, les empans sont stockés en décalages de caractères pour survivre à une retokenisation, et les conventions de frontière sont énoncées avec des exemples travaillés.

Noms d’entreprises et d’organisations

株式会社 peut précéder ou suivre un nom d’entreprise, apparaître abrégé en (株), ou être omis entièrement. Qu’il soit ou non inclus dans l’empan de l’entité change toutes les correspondances de chaînes en aval.

Notre approche Une règle unique couvre les préfixes et suffixes de forme juridique, les formes abrégées et les variantes entre parenthèses, et une forme canonique est consignée à côté de l’empan de surface.

Noms composés

Le japonais enchaîne les noms sans séparateur — 個人情報保護管理者 est une seule chaîne contenant au moins trois unités porteuses de sens. Là où l’entité s’arrête relève d’une décision, pas d’un fait.

Notre approche Les consignes fixent une politique d’empan maximal ou minimal par type d’entité, avec imbrication lorsque les deux sont réellement nécessaires, plutôt que de laisser chaque annotateur choisir.

Flexions et particules attachées

Les verbes et les adjectifs se conjuguent, et les particules s’attachent directement aux mots qu’elles marquent. Les inclure ou les exclure décale les frontières d’empans d’un ou deux caractères dans tout un corpus.

Notre approche Les terminaisons flexionnelles et les particules attachées sont explicitement dans ou hors de l’empan par règle, et un contrôle automatique signale les empans qui se terminent à l’intérieur d’un token.

Processus

Comment se déroule un projet NLP

L’essentiel de la valeur se crée avant le début de l’annotation, dans la taxonomie et les règles de frontière.

  1. 01

    Figer la taxonomie et le tokeniseur

    Nous convenons du jeu d’étiquettes, de l’analyseur et du dictionnaire, et de la représentation des empans, afin que l’annotation corresponde à la chaîne à laquelle elle est destinée.

  2. 02

    Trouver les cas limites

    Un petit échantillon est annoté pour faire apparaître les constructions réellement ambiguës de votre domaine. Elles deviennent les exemples travaillés des consignes.

  3. 03

    Calibrer et mesurer l’accord

    Les annotateurs étiquettent le même ensemble indépendamment. L’accord est mesuré séparément sur les frontières et sur les étiquettes, car ils échouent pour des raisons différentes.

  4. 04

    Annoter et arbitrer

    Annotation en production avec une passe de relecture, et arbitrage écrit des désaccords qui alimente directement les consignes.

  5. 05

    Livrer avec les décalages

    Les données sont livrées avec les décalages en caractères et le format d’étiquetage retenu, la version de taxonomie, les effectifs par étiquette et le rapport QA.

Livraison

Formats et représentation

Les décalages en caractères sont toujours inclus, quel que soit le format de surface retenu, afin que les données puissent être retokenisées sans être réannotées.

Formats de sortie courants pour l’annotation NLP japonaise.
TâcheSortie par défautÉgalement disponible
Entités nomméesJSONL avec décalages en caractèresCoNLL-U, BIO / BILOU, standoff brat
Relations et événementsJSONL avec références d’empansstandoff brat, JSON de graphe sur mesure
ClassificationJSONL ou CSVmatrices one-hot ou multi-étiquettes
SentimentJSONL avec empans d’aspectsCSV, étiquettes par phrase
NLI et similaritéPaires en JSONLCSV, TSV au format des benchmarks

Qualité

Contrôles propres à ce travail

Un jeu de données par empans peut afficher une excellente exactitude d’étiquettes et des frontières inutilisables. Nous mesurons les deux.

  • Accord sur les frontières et accord sur les étiquettes restitués comme deux chiffres distincts.
  • Validation automatique qu’aucun empan ne se termine à l’intérieur d’un token selon l’analyseur convenu.
  • Effectifs par étiquette suivis lot par lot, pour repérer une classe rare qui s’amenuise tant qu’elle peut encore être corrigée.
  • Empans imbriqués et chevauchants validés au regard des règles d’imbrication de la taxonomie plutôt qu’acceptés aveuglément.
  • Un jeu de référence annoté par des relecteurs seniors et rejoué périodiquement pour détecter la dérive sur un projet long.
  • Chaque désaccord arbitré réintégré dans les consignes sous forme d’exemple travaillé.

FAQ

À propos de l’annotation NLP japonaise

Les questions qui se posent lors du cadrage d’un projet japonais d’annotation par empans.

Celui qu’utilise votre chaîne — MeCab avec IPAdic ou UniDic, Sudachi, Juman++ ou un tokeniseur en sous-mots issu de votre propre modèle. Nous le figeons au lancement, car les frontières d’empans ne s’alignent que sur une seule segmentation, et nous stockons les décalages en caractères en dessous, de sorte qu’un changement d’analyseur ultérieur soit une réexportation et non une réannotation.

Oui, et nous préférons adopter le vôtre plutôt qu’imposer le nôtre. Ce que nous ferons, c’est le mettre à l’épreuve sur un échantillon au préalable : les taxonomies existantes comportent presque toujours deux ou trois catégories qui se recouvrent en pratique, et le découvrir pendant un pilote coûte bien moins cher que de le découvrir après cinquante mille items.

Cela dépend entièrement de la tâche. Des types d’entités nets sur du texte propre atteignent vite un accord élevé ; le sentiment par aspect et les taxonomies d’intentions fines, non — et un projet qui prétend le contraire mesure généralement quelque chose de plus facile que ce qu’il livre. Nous restituons le chiffre réel par étiquette issu du pilote, et si une catégorie ne peut pas atteindre un accord exploitable, nous le dirons et proposerons de la modifier.

Oui, lorsque la taxonomie en a réellement besoin — les noms composés et les noms d’organisations japonais en sont la raison habituelle. Les règles d’imbrication sont inscrites dans les consignes et validées automatiquement, car une imbrication autorisée mais non spécifiée est une source fiable d’incohérence.

Oui. Corriger les sorties d’un modèle est efficace pour les travaux à fort volume, avec la même réserve que partout ailleurs : les passes de correction tendent à hériter des angles morts du modèle. Nous mesurons la passe de correction contre un échantillon annoté de zéro afin que vous sachiez ce qu’elle rattrape réellement, et pour les jeux d’évaluation nous annotons de zéro.

Texte & NLP

Apportez la taxonomie. Nous trouverons ses cas limites.

Envoyez un jeu d’étiquettes et un échantillon de texte japonais réel. Nous annotons un pilote, restituons l’accord sur les frontières et sur les étiquettes, et vous disons quelles catégories ne tiendront pas en volume.

NDA avant tout partage de données. Le cadrage du pilote est gratuit.