Voz y conversación

Anotación de datos de voz y audio en japonés

Transcripción, marcas de tiempo, diarización de hablantes, etiquetado de intención y de slots, y anotación de emoción o dialecto sobre audio en japonés, producidos conforme a una convención escrita y no a una costumbre tácita.

Dos transcriptores que reciben el mismo audio en japonés sin una convención discreparán aproximadamente en una de cada tres líneas. No en qué se dijo, sino en cómo escribirlo.

La transcripción es un conjunto de decisiones, no una grabación

El japonés no tiene espacios, tiene cuatro sistemas de escritura y una gran distancia entre cómo suena una palabra y cómo se escribe por convención. Así que, en el momento en que el audio se convierte en texto, alguien ha tomado decenas de decisiones: si 有難うございます se escribe en kanji o en kana, si 3人 se escribe 3人 o 三人, si el えーっと del principio de la frase se conserva o se elimina, si un reinicio a mitad de palabra se transcribe o se corrige.

Ninguna de esas decisiones está mal por sí sola. Lo que está mal es tomarlas de forma incoherente a lo largo de un corpus, porque un modelo ASR entrenado con objetivos incoherentes aprende que un mismo sonido corresponde a varias cadenas, y su tasa de error absorbe la diferencia. La mayor palanca de calidad en los datos de voz en japonés es una convención de normalización escrita y realmente aplicada.

Por eso empezamos todos los proyectos de voz acordando ese documento — y, cuando usted ya tiene uno, adoptando el suyo en lugar de imponer el nuestro.

De un vistazo

Tipos de tarea
Transcripción literal y de lectura limpia, marcas de tiempo, diarización, etiquetado de intención y de slots, emoción y prosodia, anotación de dialecto.
Tipos de audio
Grabaciones de centros de llamadas, reuniones, entrevistas, radiodifusión, voz en el coche y en dispositivos, conversación espontánea.
Convenciones
La elección de escritura, las muletillas, los numerales, las risas y los fragmentos inaudibles se definen antes de empezar a transcribir.
Salida habitual
JSON con marcas de tiempo por palabra o por segmento; también admitimos SRT, VTT, CTM y TextGrid.
Revisión
Segunda escucha de todos los archivos, más retranscripción a ciegas de una muestra.

Tipos de tarea

Qué anotamos

La transcripción suele ser la capa base; el resto se añade sobre la misma línea temporal.

Transcripción

Literal o de lectura limpia, conforme a una convención escrita que cubre muletillas, reinicios, repeticiones, errores de pronunciación y fragmentos inaudibles.

  • Literal con disfluencias
  • Lectura limpia para facilitar la lectura
  • Marcado de inaudibles y solapamientos
  • Etiquetas de eventos no verbales

Sincronización y alineamiento

Marcas de tiempo por segmento, por enunciado o por palabra, y alineamiento forzado contra una transcripción ya existente cuando la hay.

  • Límites de enunciado
  • Marcas de tiempo por palabra
  • QA del alineamiento forzado
  • Tramos de silencio y de solapamiento

Etiquetado de hablantes

Quién habla, incluso con voces solapadas y cambios de canal: la parte que más a menudo se rompe en las grabaciones de llamadas reales.

  • Diarización e identificadores de hablante
  • Etiquetas de rol (agente / cliente)
  • Tratamiento del solapamiento
  • Anotación de atributos del hablante

Etiquetado de intención y slots

Qué pretende hacer el enunciado y qué valores transporta, superpuesto a la transcripción para trabajos de asistentes de voz y de analítica de llamadas.

  • Clasificación de intención
  • Tramos de slots y entidades
  • Etiquetas de actos de diálogo
  • Resultado y tipificación de la llamada

Etiquetado paralingüístico

Emoción, sentimiento, énfasis prosódico, estilo de habla y variedad regional, puntuados conforme a categorías definidas y no a impresiones.

  • Emoción y sentimiento
  • Estilo de habla y nivel de cortesía
  • Variedad regional y acento
  • Etiquetas de calidad y entorno del audio

Específico del japonés

Las decisiones que una convención japonesa tiene que tomar

Estas cuatro cubren la mayor parte de la discrepancia entre dos transcriptores competentes.

Elección de escritura para una misma palabra

ありがとう, 有難う y アリガトウ son la misma palabra. Si se deja al criterio de cada transcriptor, un corpus contendrá las tres, y el modelo las trata como objetivos distintos.

Cómo lo abordamos La convención enumera la escritura obligatoria de las palabras habituales, fija una regla por defecto para el resto, y una comprobación automática señala las variantes antes de la entrega.

Números y clasificadores

Los clasificadores japoneses cambian de lectura según el sustantivo que cuentan — 一本, 一杯, 一人 — y un número puede escribirse 3, 三 o 参. Si se escriben de forma incoherente, la exactitud numérica del modelo resultante deja de poder medirse.

Cómo lo abordamos Una política de numerales fija cuándo se usan cifras arábigas y cuándo kanji, y cómo se transcriben los clasificadores y las unidades, con ejemplos resueltos de fechas, importes, horas y números de teléfono.

Muletillas y disfluencias

あの, えーっと, まあ y そのー son omnipresentes en el japonés espontáneo. Conservarlas hace las transcripciones más ruidosas; eliminarlas deja los datos literales inservibles para los modelos que tratan las disfluencias.

Cómo lo abordamos Las variantes literal y de lectura limpia se definen por separado, con un inventario fijo de muletillas y una grafía para cada una, de modo que la elección es un ajuste del proyecto y no un juicio archivo por archivo.

Cortesía y formas honoríficas

El japonés de los centros de llamadas está lleno de formas honoríficas y humildes, y varias se confunden con frecuencia — いたします e いただきます, よろしいでしょうか y よろしかったでしょうか — cuando se transcribe a gran velocidad.

Cómo lo abordamos Los revisores reciben instrucciones sobre los patrones honoríficos propios de su tipo de audio, y los errores honoríficos son una categoría con nombre propio en la pasada de revisión, en lugar de diluirse en la exactitud general.

Proceso

Cómo se ejecuta un proyecto de voz

El documento de convención se escribe antes de que nadie transcriba un archivo completo, y solo se modifica mediante un cambio versionado.

  1. 01

    Muestrear y acotar

    Escuchamos una muestra representativa — incluido su peor audio, no solo el más limpio — e identificamos qué será realmente difícil.

  2. 02

    Escribir la convención

    La escritura, los numerales, las muletillas, los eventos no verbales, el solapamiento, los fragmentos inaudibles, los roles de hablante y la granularidad temporal quedan fijados en un documento que usted aprueba.

  3. 03

    Calibrar con un piloto

    Varios transcriptores trabajan los mismos archivos de forma independiente. Donde divergen, la convención era ambigua y se afina.

  4. 04

    Transcribir y revisar

    Todos los archivos reciben una segunda escucha a cargo de otra persona; una muestra se retranscribe a ciegas para obtener una cifra de exactitud medida.

  5. 05

    Entregar e informar

    Las transcripciones, las marcas de tiempo y las etiquetas se entregan con la versión de la convención, el informe de QA y una lista de los archivos marcados como inservibles en lugar de adivinados.

Entrega

Formatos de entrada y de salida

Trabajamos con su audio tal como está. Cuando un códec o una frecuencia de muestreo limita lo que se puede lograr, se lo decimos antes de empezar el proyecto y no después.

Formatos habituales de entrada y salida en el trabajo de voz en japonés.
CapaSalida por defectoTambién disponible
TranscripciónJSON con marcas de tiempo por segmentotexto plano, SRT, VTT
Marcas de tiempo por palabraJSONCTM, TextGrid
Etiquetas de hablanteRTTM o turnos de hablante en JSONtranscripciones por canal
Intención y slotsJSONL, un enunciado por líneaCSV, formato de tramos CoNLL
Etiquetas paralingüísticasJSONL con tramos temporalesCSV, archivos de anotación ELAN

Calidad

Controles propios de este trabajo

La exactitud sobre audio en japonés se mide, no se afirma — y se mide sobre los archivos difíciles, no sobre los fáciles.

  • Retranscripción a ciegas de una muestra por un segundo transcriptor, que produce una tasa de error medida por lote.
  • Comprobaciones automáticas de la convención para variantes de escritura, formato de numerales y grafía de las muletillas antes de la entrega.
  • Marcas de tiempo validadas contra el audio, no solo contra los segmentos contiguos.
  • Los archivos que realmente no se pueden transcribir se marcan y se devuelven como tales, nunca se rellenan con una suposición verosímil.
  • Etiquetas de hablante comprobadas a lo largo de todo el archivo, de modo que un intercambio de identidades a mitad de la grabación se detecta.
  • Audio difícil incluido a propósito en la muestra de QA, para que la cifra comunicada refleje el corpus y no su mejor parte.

FAQ

Sobre voz y audio

Lo que preguntan los equipos antes de enviar su primer lote de audio en japonés.

Sí, y con audio limpio suele salir más a cuenta. La salvedad es que corregir una transcripción automática sesga a la persona hacia aceptar lo que ya aparece en pantalla, así que para datos de entrenamiento o bien transcribimos desde cero, o bien hacemos una comprobación a ciegas sobre una muestra para medir cuánto está detectando realmente la pasada de corrección.

Acordamos de antemano si el dialecto se transcribe tal como se habla o se normaliza al japonés estándar, porque esa decisión cambia por completo el conjunto de datos. Cuando el dialecto entra en el alcance, anotamos la variedad, y somos francos sobre qué variedades podemos cubrir con fiabilidad y cuáles no.

Trabajamos con grabaciones reales, incluido el audio de llamadas con ancho de banda telefónico, ruido de fondo y hablantes solapados. Más que el formato importa que nos envíe una muestra representativa desde el principio: acotar sobre audio limpio y luego entregar sobre audio ruidoso es la forma habitual de que un proyecto de voz salga mal.

Sí, bajo un NDA y un acuerdo de tratamiento de datos, en un entorno aislado con acceso por roles y con condiciones de retención y borrado acordadas en el contrato. Cuando las grabaciones contienen información personal, también podemos marcarla para su anonimización, o trabajar sobre audio que usted haya anonimizado antes de enviarlo. Consulte la página de seguridad para ver el panorama completo.

Sí. El solapamiento es donde más falla la diarización automática, y es una de las principales razones para poner a una persona a hacerlo. Nuestra convención define cómo se segmenta y se atribuye el habla solapada, de modo que el tratamiento es coherente en lugar de decidirse archivo por archivo.

Voz y audio

Envíenos su audio más difícil, no el más limpio.

Una muestra representativa nos dice más que una especificación. Le devolvemos un borrador de convención, una muestra transcrita y una visión honesta de la tasa de error que cabe esperar.

NDA antes de que comparta ningún dato. La definición del piloto no tiene coste.