Sprache & Dialog

Annotation japanischer Sprach- und Audiodaten

Transkription, Zeitstempel, Sprecherdiarisierung, Intent- und Slot-Labeling sowie Emotions- oder Dialekt-Tagging auf japanischem Audio – nach einer schriftlichen Konvention statt nach ungeschriebener Gewohnheit.

Zwei Transkribierende, die dasselbe japanische Audio ohne Konvention bearbeiten, sind sich etwa bei jeder dritten Zeile uneins. Nicht darüber, was gesagt wurde, sondern darüber, wie man es schreibt.

Ein Transkript ist eine Menge von Entscheidungen, keine Aufnahme

Japanisch hat keine Leerzeichen, vier Schriftsysteme und eine große Lücke zwischen dem Klang eines Wortes und seiner üblichen Schreibung. In dem Moment, in dem Audio zu Text wird, hat also jemand Dutzende Entscheidungen getroffen: ob 有難うございます in Kanji oder Kana geschrieben wird, ob 3人 als 3人 oder 三人 erscheint, ob das えーっと am Satzanfang bleibt oder wegfällt, ob ein Neuansatz mitten im Wort transkribiert oder geglättet wird.

Keine dieser Entscheidungen ist für sich genommen falsch. Falsch ist, sie über ein Korpus hinweg uneinheitlich zu treffen, denn ein ASR-Modell, das auf uneinheitlichen Zielen trainiert wird, lernt, dass derselbe Laut auf mehrere Zeichenketten abbildet, und seine Fehlerrate schluckt die Differenz. Der größte Qualitätshebel bei japanischen Sprachdaten ist eine Normalisierungskonvention, die aufgeschrieben und tatsächlich durchgesetzt wird.

Wir beginnen deshalb jedes Sprachprojekt damit, dieses Dokument abzustimmen – und wo Sie bereits eines haben, übernehmen wir Ihres, statt Ihnen unseres aufzudrängen.

Im Überblick

Aufgabenarten
Wortgetreue und geglättete Transkription, Zeitstempel, Diarisierung, Intent- und Slot-Labeling, Emotion und Prosodie, Dialekt-Tagging.
Audiomaterial
Callcenter-Aufnahmen, Meetings, Interviews, Rundfunk, Sprache im Fahrzeug und an Geräten, spontane Gespräche.
Konventionen
Schriftwahl, Füllwörter, Ziffern, Lachen und unverständliche Passagen werden vor Transkriptionsbeginn definiert.
Typische Ausgabe
JSON mit Wort- oder Segmentzeiten; SRT, VTT, CTM und TextGrid werden ebenfalls unterstützt.
Prüfung
Zweites Abhören jeder Datei, dazu blinde Neutranskription einer Stichprobe.

Aufgabenarten

Was wir annotieren

Die Transkription ist meist die Basisschicht; alles Weitere kommt auf derselben Zeitachse dazu.

Transkription

Wortgetreu oder geglättet, nach einer schriftlichen Konvention für Füllwörter, Neuansätze, Wiederholungen, Versprecher und unverständliche Passagen.

  • Wortgetreu mit Sprechunflüssigkeiten
  • Geglättet für Lesbarkeit
  • Markierung von Unverständlichem und Überlappungen
  • Tags für nichtsprachliche Ereignisse

Zeiten und Alignment

Zeitstempel auf Segment-, Äußerungs- oder Wortebene sowie Forced Alignment gegen ein bestehendes Transkript, sofern vorhanden.

  • Äußerungsgrenzen
  • Zeiten auf Wortebene
  • QA des Forced Alignment
  • Pausen- und Überlappungsbereiche

Sprecherlabeling

Wer spricht – auch bei überlappender Sprache und Kanalwechseln, dem Teil, der an echten Telefonaufnahmen am häufigsten scheitert.

  • Diarisierung und Sprecher-IDs
  • Rollenlabels (Agent / Kunde)
  • Umgang mit Überlappungen
  • Tagging von Sprechermerkmalen

Intent- und Slot-Labeling

Was eine Äußerung erreichen will und welche Werte sie trägt, auf das Transkript gelegt für Sprachassistenten und Call-Analytics.

  • Intent-Klassifikation
  • Slot- und Entity-Spans
  • Labels für Dialogakte
  • Gesprächsausgang und Ergebnis

Paralinguistisches Labeling

Emotion, Sentiment, prosodische Betonung, Sprechstil und regionale Variante, bewertet nach definierten Kategorien statt nach Eindruck.

  • Emotion und Sentiment
  • Sprechstil und Höflichkeitsgrad
  • Regionale Variante und Akzent
  • Tags für Audioqualität und Umgebung

Japanisch-spezifisch

Die Entscheidungen, die eine japanische Konvention treffen muss

Diese vier decken den größten Teil der Uneinigkeit zwischen zwei kompetenten Transkribierenden ab.

Schriftwahl für dasselbe Wort

ありがとう, 有難う und アリガトウ sind dasselbe Wort. Überlässt man es der einzelnen Person, enthält ein Korpus alle drei, und das Modell behandelt sie als verschiedene Ziele.

Unser Vorgehen Die Konvention listet die vorgeschriebene Schrift für häufige Wörter auf, setzt für den Rest eine Standardregel, und eine automatische Prüfung markiert Varianten vor der Lieferung.

Zahlen und Zählwörter

Japanische Zählwörter ändern ihre Lesung mit dem gezählten Substantiv – 一本, 一杯, 一人 – und eine Zahl kann als 3, 三 oder 参 geschrieben werden. Uneinheitlich geschrieben wird die numerische Genauigkeit des Modells unmessbar.

Unser Vorgehen Eine Ziffernregel legt je Kontext arabisch oder Kanji fest und wie Zählwörter und Einheiten transkribiert werden, mit ausgearbeiteten Beispielen für Datum, Geld, Uhrzeit und Telefonnummern.

Füllwörter und Sprechunflüssigkeiten

あの, えーっと, まあ und そのー durchziehen spontanes Japanisch. Sie zu behalten macht Transkripte verrauschter; sie wegzulassen macht wortgetreue Daten für unflüssigkeitsbewusste Modelle unbrauchbar.

Unser Vorgehen Die wortgetreue und die geglättete Variante werden getrennt definiert, jeweils mit festem Bestand und fester Schreibung der Füllwörter, sodass die Wahl eine Projekteinstellung ist und keine Entscheidung je Datei.

Höflichkeits- und Ehrerbietungsformen

Callcenter-Japanisch ist dicht an Ehrerbietungs- und Bescheidenheitsformen, und mehrere hört man bei zügiger Arbeit leicht falsch – いたします und いただきます, よろしいでしょうか und よろしかったでしょうか.

Unser Vorgehen Die Prüfer werden auf die Höflichkeitsmuster Ihres Audiotyps eingewiesen, und Fehler bei Höflichkeitsformen sind eine eigene Kategorie im Prüfdurchlauf statt Teil der allgemeinen Genauigkeit.

Prozess

Wie ein Sprachprojekt abläuft

Das Konventionsdokument entsteht, bevor jemand eine vollständige Datei transkribiert, und wird nur über eine versionierte Änderung überarbeitet.

  1. 01

    Stichprobe und Abgrenzung

    Wir hören uns eine repräsentative Stichprobe an – auch Ihr schlechtestes Audio, nicht nur Ihr sauberstes – und stellen fest, was daran wirklich schwierig wird.

  2. 02

    Die Konvention schreiben

    Schrift, Ziffern, Füllwörter, nichtsprachliche Ereignisse, Überlappung, unverständliche Passagen, Sprecherrollen und Zeitgranularität werden in einem Dokument festgelegt, das Sie freigeben.

  3. 03

    Am Pilot kalibrieren

    Mehrere Transkribierende bearbeiten dieselben Dateien unabhängig. Wo sie auseinandergehen, war die Konvention mehrdeutig und wird geschärft.

  4. 04

    Transkribieren und prüfen

    Jede Datei wird von einer anderen Person ein zweites Mal abgehört; eine Stichprobe wird blind neu transkribiert, was eine gemessene Genauigkeitszahl ergibt.

  5. 05

    Liefern und berichten

    Transkripte, Zeiten und Labels werden mit der Konventionsversion, dem QA-Bericht und einer Liste der als unbrauchbar markierten Dateien geliefert – statt sie zu erraten.

Lieferung

Formate hinein und heraus

Wir arbeiten mit Ihrem Audio so, wie es ist. Wo ein Codec oder eine Abtastrate begrenzt, was erreichbar ist, sagen wir das vor Projektbeginn und nicht danach.

Übliche Ein- und Ausgabeformate für japanische Sprachprojekte.
EbeneStandardausgabeEbenfalls möglich
TranskriptJSON mit Segmentzeitenreiner Text, SRT, VTT
Zeiten auf WortebeneJSONCTM, TextGrid
SprecherlabelsRTTM oder JSON-SprecherzügeTranskripte je Kanal
Intent und SlotsJSONL, eine Äußerung je ZeileCSV, CoNLL-Span-Format
Paralinguistische LabelsJSONL mit ZeitbereichenCSV, ELAN-Annotationsdateien

Qualität

Kontrollen speziell für diese Arbeit

Die Genauigkeit auf japanischem Audio wird gemessen, nicht behauptet – und zwar an den schwierigen Dateien, nicht an den leichten.

  • Blinde Neutranskription einer Stichprobe durch eine zweite Person, woraus sich eine gemessene Fehlerrate je Charge ergibt.
  • Automatische Konventionsprüfungen auf Schriftvarianten, Ziffernformat und Schreibung der Füllwörter vor der Lieferung.
  • Die Zeiten werden gegen das Audio validiert, nicht nur gegen benachbarte Segmente.
  • Dateien, die sich wirklich nicht transkribieren lassen, werden als solche markiert und zurückgegeben, nie mit einer plausiblen Vermutung gefüllt.
  • Sprecherlabels werden über die ganze Datei geprüft, damit ein Identitätstausch in der Mitte auffällt.
  • Schwieriges Audio kommt bewusst in die QA-Stichprobe, damit die berichtete Zahl das Korpus abbildet und nicht seinen besten Teil.

FAQ

Zu Sprache und Audio

Was Teams fragen, bevor sie ihre erste Charge japanisches Audio schicken.

Ja, und bei sauberem Audio ist das meist wirtschaftlicher. Der Haken ist, dass das Korrigieren eines maschinellen Transkripts dazu verleitet, das Angezeigte zu akzeptieren; für Trainingsdaten transkribieren wir deshalb entweder neu oder führen eine blinde Kontrolle an einer Stichprobe durch, um zu messen, was der Korrekturdurchlauf tatsächlich findet.

Wir klären vorab, ob Dialekt so transkribiert wird, wie er gesprochen wird, oder auf Standardjapanisch normalisiert wird, denn diese Entscheidung verändert den Datensatz vollständig. Wo Dialekt im Umfang liegt, taggen wir die Variante, und wir sagen offen, welche Varianten wir zuverlässig besetzen können und welche nicht.

Wir arbeiten mit echten Aufnahmen, auch mit Telefonbandbreite, Hintergrundgeräuschen und überlappenden Sprechern. Wichtiger als das Format ist, dass Sie vorab eine repräsentative Stichprobe schicken – an sauberem Audio abzugrenzen und dann an verrauschtem zu liefern, ist der Weg, auf dem Sprachprojekte scheitern.

Ja, unter NDA und Auftragsverarbeitungsvertrag, in einer isolierten Umgebung mit rollenbasiertem Zugriff und mit vertraglich vereinbarten Aufbewahrungs- und Löschregeln. Wo Aufnahmen personenbezogene Daten enthalten, können wir diese auch zur Schwärzung markieren oder mit Audio arbeiten, das Sie vor dem Versand geschwärzt haben. Das vollständige Bild finden Sie auf der Sicherheitsseite.

Ja. Überlappung ist der Punkt, an dem automatische Diarisierung am häufigsten scheitert, und einer der Hauptgründe, einen Menschen daranzusetzen. Unsere Konvention legt fest, wie überlappende Sprache segmentiert und zugeordnet wird, damit die Behandlung einheitlich ist und nicht Datei für Datei entschieden wird.

Sprache & Audio

Schicken Sie uns Ihr schwierigstes Audio, nicht Ihr sauberstes.

Eine repräsentative Stichprobe sagt uns mehr als eine Spezifikation. Wir melden uns mit einem Konventionsentwurf, einer transkribierten Stichprobe und einer ehrlichen Einschätzung der zu erwartenden Fehlerrate.

NDA, bevor Sie Daten übermitteln. Die Planung des Pilotprojekts ist kostenlos.