Japanisches NLP

Japanische NLP-Annotation – Entitäten, Relationen und Klassifikation

Named Entity Recognition, Relationsextraktion, Intent- und Themenklassifikation, Sentiment, natürlichsprachliche Inferenz und Segmentierung – annotiert mit dem Tokenizer, den Ihre Pipeline tatsächlich verwendet.

Japanisch kennt keine Leerzeichen zwischen Wörtern. Jede Span-Annotation hängt deshalb an einer Grenzentscheidung, die jemand treffen muss, und diese Entscheidung muss zum nachgelagerten Tokenizer passen, sonst decken sich Labels und Token nicht mehr.

Die Grenzen sind das ganze Problem

Im Englischen hat „Toyota Motor Corporation“ drei offensichtliche Token, und die einzige Frage ist, wo die Entität anfängt und aufhört. Im Japanischen ist 株式会社トヨタ自動車 eine ununterbrochene Zeichenkette, und es gibt mindestens vier vertretbare Annotationen: mit oder ohne 株式会社, mit oder ohne 自動車, das Ganze als eine Entität, oder eine kürzere in eine längere geschachtelt.

Jede davon ist eine legitime Wahl. Entscheidend ist, dass jedes Mal dieselbe getroffen wird, dass sie aufgeschrieben ist und dass sie den Kontakt mit dem Tokenizer Ihres Modells übersteht – denn eine Span-Grenze mitten in einem Token lässt sich im BIO-Tagging nicht darstellen, ohne sich stillschweigend zu verschieben.

Deshalb legen wir Tokenizer und Grenzregeln fest, bevor die Annotation beginnt, und deshalb annotieren wir unter jedem gewünschten Tag-Format Zeichen-Offsets, sodass die Daten später neu tokenisiert werden können, ohne neu annotiert zu werden.

Im Überblick

Aufgabenarten
NER, Relations- und Ereignisextraktion, Intent- und Themenklassifikation, Sentiment und Emotion, NLI und Paraphrase, Segmentierung und Normalisierung.
Tokenizer-bewusst
Spans werden gegen MeCab, Sudachi, Juman++ oder den Tokenizer Ihres Modells annotiert, wie beim Kickoff vereinbart.
Grenzregeln
Rechtsformzusätze, Komposita, Höflichkeitspräfixe und Flexion sind alle durch schriftliche Regeln abgedeckt.
Typische Ausgabe
JSONL mit Zeichen-Offsets; CoNLL-U, BIO-Tagging und brat standoff werden ebenfalls unterstützt.
Prüfung
Span-Grenzen und Span-Labels werden als getrennte Kriterien geprüft.

Aufgabenarten

Was wir annotieren

Span-Aufgaben und Dokumentaufgaben haben verschiedene Fehlerbilder, also bekommen sie verschiedene Prüfkriterien.

Named Entity Recognition

Entity-Spans gegen eine für Ihre Domäne definierte Taxonomie, einschließlich geschachtelter und überlappender Entitäten, wo Sie sie brauchen.

  • Standardtypen und domänenspezifische Typen
  • Geschachtelte und diskontinuierliche Spans
  • Normalisierung auf kanonische Formen
  • Verknüpfung von Lesung und Variante

Relations- und Ereignisextraktion

Wie Entitäten zusammenhängen – wer was mit wem getan hat, welcher Wert zu welchem Feld gehört, welcher Nebensatz welchen Begriff näher bestimmt.

  • Binäre und n-stellige Relationen
  • Ereignisauslöser und Argumente
  • Satzübergreifende Relationen
  • Markierung von Negation und Unsicherheit

Klassifikation

Intent, Thema, Routing-Kategorie oder Policy-Label auf Äußerungs- oder Dokumentebene, einfach oder mehrfach vergeben.

  • Intent und Dialogakt
  • Themen- und Routing-Kategorien
  • Multi-Label-Taxonomien
  • Umgang mit „außerhalb des Umfangs“ und „unklar“

Sentiment und Emotion

Polarität und Emotion auf Dokument-, Satz- oder Aspektebene – Letzteres ist der Punkt, an dem japanische Geschäftstexte es wirklich brauchen.

  • Polarität auf Dokument- und Satzebene
  • Aspektbasiertes Sentiment
  • Emotionskategorien
  • Tagging von Höflichkeit und Register

Inferenz und Ähnlichkeit

Paare für Implikation, Paraphrase und semantische Ähnlichkeit, dazu die harten Negativbeispiele, die ein Evaluationsset trennscharf machen.

  • NLI-Implikationspaare
  • Erkennung von Paraphrasen
  • Abgestufte Ähnlichkeitswerte
  • Konstruktion harter Negativbeispiele

Japanisch-spezifisch

Die Regeln, die eine japanische Richtlinie enthalten muss

Diese vier Fragen kommen in der ersten Stunde jedes japanischen Span-Annotationsprojekts auf.

Wortgrenzen

Japanisch wird ohne Leerzeichen geschrieben, eine Span-Grenze ist also eine Ermessensentscheidung und kein Nachschlagen. Verschiedene morphologische Analysatoren segmentieren denselben Satz unterschiedlich, und Labels, die zu einem passen, passen nicht zum anderen.

Unser Vorgehen Analysator und Wörterbuch werden beim Kickoff festgelegt, Spans werden als Zeichen-Offsets gespeichert, sodass sie eine Neutokenisierung überstehen, und die Grenzkonventionen werden mit ausgearbeiteten Beispielen festgehalten.

Firmen- und Organisationsnamen

株式会社 kann einem Firmennamen vorangehen oder folgen, abgekürzt als (株) erscheinen oder ganz entfallen. Ob es innerhalb des Entity-Spans liegt, verändert jeden nachgelagerten Zeichenkettenabgleich.

Unser Vorgehen Eine einzige Regel deckt Rechtsformpräfixe und -suffixe, Kurzformen und Klammervarianten ab, und neben dem Oberflächen-Span wird eine kanonische Form festgehalten.

Komposita

Japanisch reiht Substantive ohne Trenner aneinander – 個人情報保護管理者 ist eine Zeichenkette mit mindestens drei bedeutungstragenden Einheiten. Wo die Entität endet, ist eine Entscheidung, keine Tatsache.

Unser Vorgehen Die Richtlinie legt je Entitätstyp eine Maximal- oder Minimal-Span-Politik fest, mit Schachtelung dort, wo beides wirklich gebraucht wird, statt die Wahl jedem Annotator zu überlassen.

Flexion und angehängte Partikel

Verben und Adjektive flektieren, und Partikel hängen sich direkt an die Wörter, die sie markieren. Sie einzuschließen oder auszuschließen verschiebt Span-Grenzen im ganzen Korpus um ein bis zwei Zeichen.

Unser Vorgehen Flexionsendungen und angehängte Partikel sind per Regel ausdrücklich im Span enthalten oder nicht, und eine automatische Prüfung markiert Spans, die innerhalb eines Tokens enden.

Prozess

Wie ein NLP-Projekt abläuft

Der größte Teil des Werts entsteht vor der Annotation, in der Taxonomie und den Grenzregeln.

  1. 01

    Taxonomie und Tokenizer festlegen

    Wir einigen uns auf das Labelset, den Analysator samt Wörterbuch und die Darstellung der Spans, damit die Annotation zu der Pipeline passt, für die sie bestimmt ist.

  2. 02

    Die Grenzfälle finden

    Eine kleine Stichprobe wird annotiert, um die wirklich mehrdeutigen Konstruktionen Ihrer Domäne sichtbar zu machen. Sie werden zu den ausgearbeiteten Beispielen in der Richtlinie.

  3. 03

    Kalibrieren und Übereinstimmung messen

    Annotatoren labeln dasselbe Set unabhängig. Die Übereinstimmung wird für Grenzen und Labels getrennt gemessen, weil sie aus verschiedenen Gründen scheitern.

  4. 04

    Annotieren und entscheiden

    Produktionsannotation mit einem Prüfdurchlauf und schriftlicher Entscheidung bei Abweichungen, die direkt in die Richtlinie zurückfließt.

  5. 05

    Mit Offsets liefern

    Die Daten kommen mit Zeichen-Offsets und Ihrem gewählten Tag-Format, der Taxonomieversion, den Zählungen je Label und dem QA-Bericht.

Lieferung

Formate und Darstellung

Zeichen-Offsets sind immer enthalten, gleich welches Oberflächenformat Sie nehmen, damit die Daten ohne Neuannotation neu tokenisiert werden können.

Übliche Ausgabeformate für japanische NLP-Annotation.
AufgabeStandardausgabeEbenfalls möglich
EigennamenJSONL mit Zeichen-OffsetsCoNLL-U, BIO / BILOU, brat standoff
Relationen und EreignisseJSONL mit Span-Referenzenbrat standoff, eigenes Graph-JSON
KlassifikationJSONL oder CSVOne-Hot- oder Multi-Label-Matrizen
SentimentJSONL mit Aspekt-SpansCSV, Labels je Satz
NLI und ÄhnlichkeitJSONL-PaareCSV, TSV im Benchmark-Layout

Qualität

Kontrollen speziell für diese Arbeit

Ein Span-Datensatz kann hervorragende Labelgenauigkeit und unbrauchbare Grenzen haben. Wir messen beides.

  • Grenzübereinstimmung und Labelübereinstimmung werden als getrennte Zahlen berichtet.
  • Automatische Validierung, dass unter dem vereinbarten Analysator kein Span innerhalb eines Tokens endet.
  • Die Zählungen je Label werden pro Charge verfolgt, damit eine ausdünnende seltene Klasse auffällt, solange sich das noch beheben lässt.
  • Geschachtelte und überlappende Spans werden gegen die Schachtelungsregeln der Taxonomie validiert statt blind übernommen.
  • Ein von Senior-Prüfern annotiertes Gold-Set wird regelmäßig erneut durchlaufen, um Drift über ein langes Projekt zu erkennen.
  • Jede entschiedene Abweichung wird als ausgearbeitetes Beispiel in die Richtlinie zurückgeschrieben.

FAQ

Zur japanischen NLP-Annotation

Die Fragen, die aufkommen, wenn ein japanisches Span-Annotationsprojekt abgegrenzt wird.

Den, den Ihre Pipeline verwendet – MeCab mit IPAdic oder UniDic, Sudachi, Juman++ oder einen Subword-Tokenizer aus Ihrem eigenen Modell. Wir legen ihn beim Kickoff fest, weil Span-Grenzen immer nur zu einer Segmentierung passen, und wir speichern darunter Zeichen-Offsets, sodass ein späterer Wechsel des Analysators ein Re-Export statt einer Neuannotation ist.

Ja, und wir übernehmen lieber Ihres, als Ihnen unseres aufzudrängen. Was wir tun werden, ist, es zuerst an einer Stichprobe zu erproben: Bestehende Taxonomien haben meist zwei oder drei Kategorien, die sich in der Praxis überschneiden, und das im Pilotprojekt zu finden ist viel billiger, als es nach fünfzigtausend Elementen zu finden.

Das hängt ganz von der Aufgabe ab. Klar abgegrenzte Entitätstypen auf sauberem Text erreichen schnell hohe Übereinstimmung; aspektbasiertes Sentiment und feingranulare Intent-Taxonomien nicht, und ein Projekt, das etwas anderes behauptet, misst meist etwas Leichteres, als es liefert. Wir berichten die tatsächliche Zahl je Label aus dem Pilotprojekt, und wenn eine Kategorie keine brauchbare Übereinstimmung erreicht, sagen wir das und schlagen vor, die Kategorie zu ändern.

Ja, wo die Taxonomie sie wirklich braucht – japanische Komposita und Organisationsnamen sind der übliche Grund. Die Schachtelungsregeln werden in die Richtlinie geschrieben und automatisch validiert, denn eine Schachtelung, die erlaubt, aber nicht spezifiziert ist, ist eine verlässliche Quelle von Inkonsistenz.

Ja. Modellausgaben zu korrigieren ist bei hohem Volumen effizient, mit demselben Vorbehalt wie überall sonst: Korrekturdurchläufe erben tendenziell die blinden Flecken des Modells. Wir messen den Korrekturdurchlauf gegen eine von Grund auf annotierte Stichprobe, damit Sie wissen, was er tatsächlich findet, und für Evaluationssets annotieren wir von Grund auf.

Text & NLP

Bringen Sie die Taxonomie. Wir finden ihre Grenzfälle.

Schicken Sie ein Labelset und eine Stichprobe echten japanischen Textes. Wir annotieren einen Pilot, berichten Grenz- und Labelübereinstimmung und sagen Ihnen, welche Kategorien im Volumen nicht halten werden.

NDA, bevor Sie Daten übermitteln. Die Planung des Pilotprojekts ist kostenlos.