Parole et conversation

Annotation de données vocales et audio en japonais

Transcription, horodatage, diarisation des locuteurs, étiquetage d’intentions et de slots, marquage de l’émotion ou du dialecte sur de l’audio japonais — produits selon une convention écrite plutôt que selon une habitude tacite.

Deux transcripteurs qui reçoivent le même audio japonais sans convention divergeront environ une ligne sur trois. Non pas sur ce qui a été dit, mais sur la manière de l’écrire.

Une transcription est un ensemble de décisions, pas un enregistrement

Le japonais n’a pas d’espaces, compte quatre systèmes d’écriture et présente un large écart entre la façon dont un mot sonne et la façon dont on l’écrit conventionnellement. Dès qu’un audio devient du texte, quelqu’un a donc opéré des dizaines de choix : écrire 有難うございます en kanji ou en kana, écrire 3人 ou 三人, conserver ou supprimer le えーっと en début de phrase, transcrire ou corriger une reprise en milieu de mot.

Aucun de ces choix n’est faux en soi. Ce qui est faux, c’est de les opérer de façon incohérente à l’échelle d’un corpus, car un modèle ASR entraîné sur des cibles incohérentes apprend qu’un même son correspond à plusieurs chaînes, et son taux d’erreur absorbe la différence. Le principal levier de qualité des données vocales japonaises est une convention de normalisation écrite et réellement appliquée.

Nous commençons donc tout projet de parole par la rédaction concertée de ce document — et lorsque vous en avez déjà un, en adoptant le vôtre plutôt qu’en imposant le nôtre.

En bref

Types de tâches
Transcription verbatim et épurée, horodatage, diarisation, étiquetage d’intentions et de slots, émotion et prosodie, marquage dialectal.
Audio pris en charge
Enregistrements de centres d’appels, réunions, entretiens, diffusion, parole embarquée et sur appareil, conversation spontanée.
Conventions
Choix d’écriture, hésitations, chiffres, rires et passages inaudibles sont tous définis avant le début de la transcription.
Sortie habituelle
JSON avec horodatage au mot ou au segment ; SRT, VTT, CTM et TextGrid également pris en charge.
Relecture
Seconde écoute sur chaque fichier, plus une retranscription à l’aveugle sur un échantillon.

Types de tâches

Ce que nous annotons

La transcription est généralement la couche de base ; le reste s’ajoute par-dessus, sur la même ligne de temps.

Transcription

Verbatim ou épurée, selon une convention écrite couvrant les hésitations, les reprises, les répétitions, les erreurs de prononciation et les passages inaudibles.

  • Verbatim avec disfluences
  • Version épurée pour la lisibilité
  • Marquage des inaudibles et des chevauchements
  • Étiquettes d’événements non verbaux

Horodatage et alignement

Horodatage au segment, à l’énoncé ou au mot, et alignement forcé sur une transcription existante lorsqu’il y en a une.

  • Frontières d’énoncés
  • Horodatage au mot
  • QA de l’alignement forcé
  • Plages de silence et de chevauchement

Étiquetage des locuteurs

Qui parle, à travers les chevauchements de parole et les changements de canal — la partie qui casse le plus souvent sur de vrais enregistrements d’appels.

  • Diarisation et identifiants de locuteurs
  • Étiquettes de rôle (conseiller / client)
  • Traitement des chevauchements
  • Marquage des attributs du locuteur

Étiquetage d’intentions et de slots

Ce que l’énoncé cherche à faire et les valeurs qu’il porte, superposés à la transcription pour les assistants vocaux et l’analyse d’appels.

  • Classification d’intentions
  • Empans de slots et d’entités
  • Étiquettes d’actes de dialogue
  • Issue et qualification de l’appel

Étiquetage paralinguistique

Émotion, sentiment, emphase prosodique, style de parole et variété régionale, notés selon des catégories définies plutôt que d’après une impression.

  • Émotion et sentiment
  • Style de parole et niveau de politesse
  • Variété régionale et accent
  • Étiquettes de qualité audio et d’environnement

Spécificités japonaises

Les décisions qu’une convention japonaise doit trancher

Ces quatre points couvrent l’essentiel des désaccords entre deux transcripteurs compétents.

Choix d’écriture pour un même mot

ありがとう, 有難う et アリガトウ sont le même mot. Laissé à l’appréciation de chaque transcripteur, un corpus contiendra les trois, et le modèle les traitera comme des cibles différentes.

Notre approche La convention énumère l’écriture requise pour les mots courants, fixe une règle par défaut pour les autres, et un contrôle automatique signale les variantes avant livraison.

Nombres et classificateurs

Les classificateurs japonais changent de lecture selon le nom qu’ils comptent — 一本, 一杯, 一人 — et un nombre peut s’écrire 3, 三 ou 参. Transcrits de façon incohérente, ces éléments rendent l’exactitude numérique du modèle obtenu impossible à mesurer.

Notre approche Une politique des chiffres fixe le recours aux chiffres arabes ou aux kanji selon le contexte, ainsi que la transcription des classificateurs et des unités, avec des exemples travaillés pour les dates, les montants, les heures et les numéros de téléphone.

Hésitations et disfluences

あの, えーっと, まあ et そのー sont omniprésents dans le japonais spontané. Les conserver rend les transcriptions plus bruitées ; les supprimer rend les données verbatim inutilisables pour les modèles sensibles aux disfluences.

Notre approche Les variantes verbatim et épurée sont définies séparément, avec un inventaire d’hésitations et une orthographe fixes pour chacune, de sorte que le choix relève d’un paramètre de projet et non d’un jugement fichier par fichier.

Formes de politesse et honorifiques

Le japonais des centres d’appels est dense en formes honorifiques et humbles, dont plusieurs sont couramment mal entendues — いたします et いただきます, よろしいでしょうか et よろしかったでしょうか — par des transcripteurs qui travaillent vite.

Notre approche Les relecteurs sont briefés sur les schémas honorifiques propres à votre type d’audio, et les erreurs honorifiques constituent une catégorie nommée de la passe de relecture au lieu d’être fondues dans l’exactitude générale.

Processus

Comment se déroule un projet de parole

Le document de convention est rédigé avant que quiconque transcrive un fichier complet, et n’est révisé que par une modification versionnée.

  1. 01

    Échantillonner et cadrer

    Nous écoutons un échantillon représentatif — y compris votre plus mauvais audio, pas seulement le plus propre — et identifions ce qui sera réellement difficile.

  2. 02

    Rédiger la convention

    Écriture, chiffres, hésitations, événements non verbaux, chevauchements, passages inaudibles, rôles des locuteurs et granularité de l’horodatage sont tous fixés dans un document que vous approuvez.

  3. 03

    Calibrer sur un pilote

    Plusieurs transcripteurs traitent les mêmes fichiers indépendamment. Là où ils divergent, la convention était ambiguë et se voit précisée.

  4. 04

    Transcrire et relire

    Chaque fichier fait l’objet d’une seconde écoute par une autre personne ; un échantillon est retranscrit à l’aveugle pour produire un taux d’exactitude mesuré.

  5. 05

    Livrer et restituer

    Transcriptions, horodatages et étiquettes sont livrés avec la version de la convention, le rapport QA et la liste des fichiers signalés comme inexploitables plutôt que devinés.

Livraison

Formats en entrée et en sortie

Nous travaillons à partir de votre audio tel qu’il est. Lorsqu’un codec ou une fréquence d’échantillonnage limite ce qui est atteignable, nous le disons avant le début du projet plutôt qu’après.

Formats d’entrée et de sortie courants pour les travaux de parole en japonais.
CoucheSortie par défautÉgalement disponible
TranscriptionJSON avec horodatage par segmenttexte brut, SRT, VTT
Horodatage au motJSONCTM, TextGrid
Étiquettes de locuteursRTTM ou tours de parole en JSONtranscriptions par canal
Intentions et slotsJSONL, un énoncé par ligneCSV, format d’empans CoNLL
Étiquettes paralinguistiquesJSONL avec plages temporellesCSV, fichiers d’annotation ELAN

Qualité

Contrôles propres à ce travail

L’exactitude sur de l’audio japonais se mesure, elle ne s’affirme pas — et elle se mesure sur les fichiers difficiles, pas sur les faciles.

  • Retranscription à l’aveugle d’un échantillon par un second transcripteur, produisant un taux d’erreur mesuré par lot.
  • Contrôles automatiques de la convention pour les variantes d’écriture, le format des chiffres et l’orthographe des hésitations avant livraison.
  • Horodatage validé contre l’audio, et non seulement contre les segments voisins.
  • Les fichiers réellement impossibles à transcrire sont signalés et renvoyés comme tels, jamais comblés par une supposition plausible.
  • Étiquettes de locuteurs vérifiées sur l’ensemble du fichier, afin de détecter une inversion d’identité en cours de route.
  • Audio difficile inclus délibérément dans l’échantillon QA, pour que le chiffre restitué reflète le corpus et non sa meilleure partie.

FAQ

À propos de la parole et de l’audio

Ce que demandent les équipes avant d’envoyer leur premier lot d’audio japonais.

Oui, et sur de l’audio propre c’est généralement le meilleur rapport qualité-prix. La réserve est que corriger une transcription automatique incite l’humain à accepter ce qui est déjà à l’écran ; pour des données d’entraînement, nous transcrivons donc de zéro ou nous effectuons un contrôle à l’aveugle sur un échantillon afin de mesurer ce que la passe de correction rattrape réellement.

Nous convenons à l’avance si le dialecte est transcrit tel qu’il est prononcé ou normalisé en japonais standard, car cette décision change entièrement le jeu de données. Lorsque le dialecte entre dans le périmètre, nous marquons la variété, et nous sommes francs sur les variétés que nous pouvons couvrir de façon fiable et celles que nous ne pouvons pas.

Nous travaillons sur de vrais enregistrements, y compris de l’audio téléphonique à bande étroite, du bruit de fond et des locuteurs qui se chevauchent. Ce qui compte davantage que le format, c’est que vous envoyiez d’emblée un échantillon représentatif — cadrer sur de l’audio propre puis livrer sur de l’audio bruité, c’est ainsi que les projets de parole échouent.

Oui, sous NDA et accord de traitement des données, dans un environnement isolé avec accès par rôle, et avec des durées de conservation et des modalités de suppression convenues au contrat. Lorsque les enregistrements contiennent des informations personnelles, nous pouvons aussi les marquer en vue d’un caviardage, ou travailler sur de l’audio que vous avez caviardé avant envoi. Voir la page sécurité pour le tableau complet.

Oui. C’est sur les chevauchements que la diarisation automatique échoue le plus souvent, et c’est l’une des principales raisons d’y placer un humain. Notre convention définit comment la parole en chevauchement est segmentée et attribuée, afin que le traitement soit cohérent au lieu d’être décidé fichier par fichier.

Parole & audio

Envoyez-nous votre audio le plus difficile, pas le plus propre.

Un échantillon représentatif nous en apprend plus qu’un cahier des charges. Nous revenons vers vous avec un projet de convention, un échantillon transcrit et un avis honnête sur le taux d’erreur à attendre.

NDA avant tout partage de données. Le cadrage du pilote est gratuit.