Fala e conversação

Anotação de dados de fala e áudio em japonês

Transcrição, marcação de tempo, diarização de falantes, rotulagem de intenção e slots e marcação de emoção ou dialeto em áudio japonês — produzidas segundo uma convenção escrita, e não segundo um hábito não escrito.

Dois transcritores diante do mesmo áudio em japonês e sem convenção vão divergir em aproximadamente uma linha a cada três. Não sobre o que foi dito, mas sobre como escrever.

A transcrição é um conjunto de decisões, não uma gravação

O japonês não tem espaços, tem quatro sistemas de escrita e uma distância grande entre como uma palavra soa e como ela é convencionalmente escrita. Assim, no momento em que o áudio vira texto, alguém já tomou dezenas de decisões: se 有難うございます se escreve em kanji ou em kana, se 3人 fica como 3人 ou 三人, se o えーっと no começo da frase é mantido ou removido, se um recomeço no meio da palavra é transcrito ou corrigido.

Nenhuma dessas escolhas é errada isoladamente. Errado é fazê-las de forma inconsistente ao longo de um corpus, porque um modelo de ASR treinado com alvos inconsistentes aprende que o mesmo som corresponde a várias cadeias de caracteres, e a taxa de erro absorve a diferença. A maior alavanca de qualidade em dados de fala em japonês é uma convenção de normalização que esteja escrita e seja de fato cumprida.

Por isso começamos todo projeto de fala acordando esse documento — e, quando você já tem um, adotando o seu em vez de impor o nosso.

Resumo

Tipos de tarefa
Transcrição literal e limpa, marcação de tempo, diarização, rotulagem de intenção e slots, emoção e prosódia, marcação de dialeto.
Tipos de áudio
Gravações de call center, reuniões, entrevistas, radiodifusão, fala em veículos e dispositivos, conversa espontânea.
Convenções
Escolha de escrita, fillers, numerais, risadas e trechos inaudíveis são todos definidos antes de a transcrição começar.
Saída típica
JSON com marcações de tempo por palavra ou segmento; SRT, VTT, CTM e TextGrid também são suportados.
Revisão
Segunda escuta em cada arquivo, mais retranscrição às cegas em uma amostra.

Tipos de tarefa

O que anotamos

A transcrição costuma ser a camada de base; as demais são acrescentadas sobre a mesma linha do tempo.

Transcrição

Literal ou limpa, segundo uma convenção escrita que cobre fillers, recomeços, repetições, erros de pronúncia e trechos inaudíveis.

  • Literal, com disfluências
  • Leitura limpa, voltada à legibilidade
  • Marcação de inaudível e de sobreposição
  • Tags de eventos não vocais

Tempo e alinhamento

Marcações de tempo por segmento, enunciado ou palavra, e alinhamento forçado contra uma transcrição já existente, quando houver.

  • Fronteiras de enunciado
  • Marcações de tempo por palavra
  • QA de alinhamento forçado
  • Trechos de silêncio e de sobreposição

Rotulagem de falantes

Quem está falando, ao longo de falas sobrepostas e de mudanças de canal — a parte que mais costuma quebrar em gravações reais de chamadas.

  • Diarização e IDs de falante
  • Rótulos de papel (atendente / cliente)
  • Tratamento de sobreposição
  • Marcação de atributos do falante

Rotulagem de intenção e slots

O que o enunciado tenta fazer e que valores ele carrega, sobrepostos à transcrição para trabalhos de assistente de voz e de análise de chamadas.

  • Classificação de intenção
  • Spans de slots e entidades
  • Rótulos de atos de diálogo
  • Desfecho e encaminhamento da chamada

Rotulagem paralinguística

Emoção, sentimento, ênfase prosódica, estilo de fala e variedade regional, pontuados segundo categorias definidas em vez de impressões.

  • Emoção e sentimento
  • Estilo de fala e nível de polidez
  • Variedade regional e sotaque
  • Tags de qualidade do áudio e de ambiente

Especificidades do japonês

As decisões que uma convenção para o japonês precisa tomar

Estas quatro cobrem a maior parte da divergência entre dois transcritores competentes.

Escolha de escrita para a mesma palavra

ありがとう, 有難う e アリガトウ são a mesma palavra. Deixado a critério de cada transcritor, um corpus vai conter as três formas, e o modelo as trata como alvos diferentes.

Como tratamos A convenção lista a escrita exigida para as palavras comuns, define uma regra padrão para as demais, e uma verificação automática sinaliza variantes antes da entrega.

Números e classificadores

Os classificadores japoneses mudam de leitura conforme o substantivo que contam — 一本, 一杯, 一人 — e um número pode ser escrito como 3, 三 ou 参. Se forem escritos de forma inconsistente, a acurácia numérica do modelo resultante fica impossível de medir.

Como tratamos Uma política de numerais fixa o uso de algarismos arábicos ou de kanji por contexto, e como classificadores e unidades são transcritos, com exemplos comentados para datas, valores, horas e telefones.

Fillers e disfluências

あの, えーっと, まあ e そのー são onipresentes no japonês espontâneo. Mantê-los deixa as transcrições mais ruidosas; removê-los torna os dados literais inúteis para modelos que precisam lidar com disfluências.

Como tratamos As variantes literal e limpa são definidas separadamente, com um inventário fixo de fillers e a grafia de cada um, de modo que a escolha seja uma configuração do projeto e não um julgamento arquivo a arquivo.

Formas de polidez e honoríficas

O japonês de call center é denso em formas honoríficas e humildes, e várias são comumente ouvidas errado — いたします e いただきます, よろしいでしょうか e よろしかったでしょうか — por transcritores trabalhando em ritmo acelerado.

Como tratamos Os revisores são orientados sobre os padrões honoríficos específicos do seu tipo de áudio, e os erros de honorífico são uma categoria nomeada na passagem de revisão, em vez de serem diluídos na acurácia geral.

Processo

Como um projeto de fala é conduzido

O documento de convenção é escrito antes de alguém transcrever um arquivo inteiro, e só é revisado por meio de uma alteração versionada.

  1. 01

    Amostrar e definir o escopo

    Ouvimos uma amostra representativa — incluindo o seu pior áudio, não apenas o mais limpo — e identificamos o que de fato será difícil ali.

  2. 02

    Escrever a convenção

    Escrita, numerais, fillers, eventos não vocais, sobreposição, trechos inaudíveis, papéis de falante e granularidade das marcações de tempo são todos fixados em um documento aprovado por você.

  3. 03

    Calibrar em um piloto

    Vários transcritores trabalham os mesmos arquivos de forma independente. Onde divergem, a convenção estava ambígua e é afinada.

  4. 04

    Transcrever e revisar

    Cada arquivo recebe uma segunda escuta feita por outra pessoa; uma amostra é retranscrita às cegas para produzir um índice de acurácia medido.

  5. 05

    Entregar e reportar

    Transcrições, marcações de tempo e rótulos são entregues com a versão da convenção, o relatório de QA e uma lista dos arquivos sinalizados como inutilizáveis, em vez de adivinhados.

Entrega

Formatos de entrada e de saída

Trabalhamos com o seu áudio como ele é. Quando um codec ou uma taxa de amostragem limita o que é possível, dizemos isso antes de o projeto começar, e não depois.

Formatos comuns de entrada e de saída para trabalhos de fala em japonês.
CamadaSaída padrãoTambém disponível
TranscriçãoJSON com marcações de tempo por segmentotexto simples, SRT, VTT
Marcação de tempo por palavraJSONCTM, TextGrid
Rótulos de falanteRTTM ou turnos de falante em JSONtranscrições por canal
Intenção e slotsJSONL, um enunciado por linhaCSV, formato de spans CoNLL
Rótulos paralinguísticosJSONL com intervalos de tempoCSV, arquivos de anotação ELAN

Qualidade

Controles específicos deste trabalho

A acurácia em áudio japonês é medida, não afirmada — e medida nos arquivos difíceis, não nos fáceis.

  • Retranscrição às cegas de uma amostra por um segundo transcritor, produzindo uma taxa de erro medida por lote.
  • Verificações automáticas da convenção quanto a variantes de escrita, formato de numerais e grafia de fillers antes da entrega.
  • Marcações de tempo validadas contra o áudio, e não apenas contra os segmentos vizinhos.
  • Arquivos que realmente não podem ser transcritos são sinalizados e devolvidos como tal, nunca preenchidos com um palpite plausível.
  • Rótulos de falante conferidos ao longo de todo o arquivo, para que uma troca de identidade no meio do caminho seja detectada.
  • Áudio difícil incluído deliberadamente na amostra de QA, para que o número reportado reflita o corpus e não a sua melhor parte.

FAQ

Sobre fala e áudio

O que os times perguntam antes de enviar o primeiro lote de áudio em japonês.

Podemos, sim, e para áudio limpo isso costuma ter melhor custo-benefício. A ressalva é que corrigir uma transcrição automática enviesa a pessoa a aceitar o que já está na tela; então, para dados de treinamento, ou transcrevemos do zero ou fazemos uma checagem às cegas em uma amostra para medir quanto a passagem de correção está realmente pegando.

Combinamos de antemão se o dialeto é transcrito tal como falado ou normalizado para o japonês padrão, porque essa decisão muda o conjunto de dados por completo. Quando o dialeto está no escopo, marcamos a variedade, e somos francos sobre quais variedades conseguimos cobrir de forma confiável e quais não conseguimos.

Trabalhamos com gravações reais, incluindo áudio de chamadas em banda telefônica, ruído de fundo e falantes sobrepostos. Mais importante do que o formato é você enviar uma amostra representativa desde o início. Definir o escopo com áudio limpo e depois entregar sobre áudio ruidoso: é assim que projetos de fala dão errado.

Sim, sob NDA e acordo de processamento de dados, em um ambiente isolado com acesso baseado em funções e com prazos de retenção e método de exclusão acordados em contrato. Quando as gravações contêm informações pessoais, também podemos marcá-las para supressão, ou trabalhar sobre áudio que você já tenha tratado antes de enviar. Veja a página de segurança para o quadro completo.

Sim. A sobreposição é onde a diarização automática mais falha, e é uma das principais razões para colocar uma pessoa nessa tarefa. Nossa convenção define como a fala sobreposta é segmentada e atribuída, de modo que o tratamento seja consistente em vez de decidido arquivo a arquivo.

Fala e áudio

Envie o seu áudio mais difícil, não o mais limpo.

Uma amostra representativa nos diz mais do que uma especificação. Voltamos com um rascunho de convenção, uma amostra transcrita e uma visão honesta da taxa de erro a esperar.

NDA antes de você compartilhar qualquer dado. A definição do escopo do piloto é gratuita.