NLP em japonês

Anotação de NLP em japonês — entidades, relações e classificação

Reconhecimento de entidades nomeadas, extração de relações, classificação de intenção e de tópico, sentimento, inferência em linguagem natural e segmentação — anotados com o tokenizador que o seu pipeline realmente usa.

O japonês não tem espaços entre as palavras. Toda anotação de span depende, portanto, de uma decisão de fronteira que alguém precisa tomar, e essa decisão tem de coincidir com o tokenizador usado adiante, ou os rótulos não vão se alinhar.

As fronteiras são o problema inteiro

Em inglês, “Toyota Motor Corporation” tem três tokens evidentes, e a única questão é onde a entidade começa e termina. Em japonês, 株式会社トヨタ自動車 é uma cadeia sem separação, e existem pelo menos quatro anotações defensáveis: com ou sem 株式会社, com ou sem 自動車, tratando tudo como uma entidade única ou aninhando uma menor dentro de uma maior.

Cada uma delas é uma escolha legítima. O que importa é que a mesma escolha seja feita sempre, que ela esteja escrita e que sobreviva ao contato com o tokenizador que o seu modelo usa — porque uma fronteira de span que cai no meio de um token não pode ser representada em marcação BIO sem se deslocar silenciosamente.

É por isso que fixamos o tokenizador e as regras de fronteira antes de a anotação começar, e por isso anotamos offsets de caractere por baixo de qualquer formato de tag que você queira, para que os dados possam ser retokenizados depois sem serem reanotados.

Resumo

Tipos de tarefa
NER, extração de relações e de eventos, classificação de intenção e de tópico, sentimento e emoção, NLI e paráfrase, segmentação e normalização.
Ciente do tokenizador
Spans anotados contra MeCab, Sudachi, Juman++ ou o tokenizador do seu próprio modelo, conforme acordado no kickoff.
Regras de fronteira
Sufixos de razão social, substantivos compostos, prefixos honoríficos e flexão são todos cobertos por regras escritas.
Saída típica
JSONL com offsets de caractere; CoNLL-U, marcação BIO e brat standoff também são suportados.
Revisão
Fronteiras de span e rótulos de span revisados como critérios separados.

Tipos de tarefa

O que anotamos

Tarefas de span e tarefas de documento têm modos de falha diferentes, então recebem critérios de revisão diferentes.

Reconhecimento de entidades nomeadas

Spans de entidade segundo uma taxonomia definida para o seu domínio, incluindo entidades aninhadas e sobrepostas quando você precisar delas.

  • Tipos padrão e específicos do domínio
  • Spans aninhados e descontínuos
  • Normalização para formas canônicas
  • Vínculo de leitura e de variantes

Extração de relações e eventos

Como as entidades se conectam — quem fez o quê a quem, qual valor pertence a qual campo, qual oração modifica qual termo.

  • Relações binárias e n-árias
  • Gatilhos e argumentos de eventos
  • Relações entre frases
  • Marcação de negação e de incerteza

Classificação

Intenção, tópico, categoria de encaminhamento ou rótulo de política, no nível do enunciado ou do documento, com rótulo único ou múltiplo.

  • Intenção e ato de diálogo
  • Categorias de tópico e de encaminhamento
  • Taxonomias multirrótulo
  • Tratamento de casos fora de escopo e incertos

Sentimento e emoção

Polaridade e emoção no nível do documento, da frase ou do aspecto — sendo o último aquele de que o texto de negócios em japonês realmente precisa.

  • Polaridade de documento e de frase
  • Sentimento por aspecto
  • Categorias de emoção
  • Marcação de polidez e de registro

Inferência e similaridade

Pares de implicação, paráfrase e similaridade semântica, mais os negativos difíceis que fazem um conjunto de avaliação discriminar.

  • Pares de implicação para NLI
  • Identificação de paráfrase
  • Pontuações graduadas de similaridade
  • Construção de negativos difíceis

Especificidades do japonês

As regras que uma diretriz para o japonês precisa conter

Estas quatro questões aparecem na primeira hora de todo projeto de anotação de spans em japonês.

Fronteiras de palavra

O japonês é escrito sem espaços, então uma fronteira de span é um julgamento, não uma consulta. Analisadores morfológicos diferentes segmentam a mesma frase de formas diferentes, e rótulos alinhados a um não se alinham a outro.

Como tratamos O analisador e o dicionário são fixados no kickoff, os spans são armazenados como offsets de caractere para sobreviverem à retokenização, e as convenções de fronteira são declaradas com exemplos comentados.

Nomes de empresas e organizações

株式会社 pode vir antes ou depois do nome da empresa, aparecer abreviado como (株) ou ser omitido por completo. Estar ou não dentro do span da entidade muda toda comparação de cadeias feita adiante.

Como tratamos Uma única regra cobre prefixos e sufixos de forma jurídica, formas abreviadas e variantes entre parênteses, e uma forma canônica é registrada ao lado do span de superfície.

Substantivos compostos

O japonês encadeia substantivos sem separadores — 個人情報保護管理者 é uma única cadeia que contém pelo menos três unidades de significado. Onde a entidade termina é uma decisão, não um fato.

Como tratamos A diretriz define uma política de span máximo ou mínimo por tipo de entidade, com aninhamento quando ambos forem genuinamente necessários, em vez de deixar a escolha para cada anotador.

Flexão e partículas anexadas

Verbos e adjetivos flexionam, e as partículas se ligam diretamente às palavras que marcam. Incluí-las ou excluí-las desloca as fronteiras dos spans em um ou dois caracteres ao longo de todo um corpus.

Como tratamos As terminações flexionais e as partículas anexadas ficam explicitamente dentro ou fora do span por regra, e uma verificação automática sinaliza spans que terminam dentro de um token.

Processo

Como um projeto de NLP é conduzido

A maior parte do valor é criada antes de a anotação começar, na taxonomia e nas regras de fronteira.

  1. 01

    Fixar a taxonomia e o tokenizador

    Acordamos o conjunto de rótulos, o analisador e o dicionário, e como os spans serão representados, para que a anotação corresponda ao pipeline a que se destina.

  2. 02

    Encontrar os casos-limite

    Uma pequena amostra é anotada para trazer à tona as construções genuinamente ambíguas do seu domínio. Elas viram os exemplos comentados da diretriz.

  3. 03

    Calibrar e medir a concordância

    Os anotadores rotulam o mesmo conjunto de forma independente. A concordância é medida separadamente para fronteiras e para rótulos, porque eles falham por razões diferentes.

  4. 04

    Anotar e arbitrar

    Anotação em produção com uma passagem de revisão e arbitragem escrita das divergências, que volta direto para a diretriz.

  5. 05

    Entregar com offsets

    Os dados são entregues com offsets de caractere e o formato de tag escolhido por você, a versão da taxonomia, as contagens por rótulo e o relatório de QA.

Entrega

Formatos e representação

Os offsets de caractere sempre são incluídos, qualquer que seja o formato de superfície escolhido, para que os dados possam ser retokenizados sem serem reanotados.

Formatos de saída comuns para anotação de NLP em japonês.
TarefaSaída padrãoTambém disponível
Entidades nomeadasJSONL com offsets de caractereCoNLL-U, BIO / BILOU, brat standoff
Relações e eventosJSONL com referências a spansbrat standoff, JSON de grafo personalizado
ClassificaçãoJSONL ou CSVmatrizes one-hot ou multirrótulo
SentimentoJSONL com spans de aspectoCSV, rótulos por frase
NLI e similaridadepares em JSONLCSV, TSV em layout de benchmark

Qualidade

Controles específicos deste trabalho

Um conjunto de spans pode ter excelente acurácia de rótulo e fronteiras inutilizáveis. Medimos as duas coisas.

  • Concordância de fronteira e concordância de rótulo reportadas como números separados.
  • Validação automática de que nenhum span termina dentro de um token segundo o analisador acordado.
  • Contagens por rótulo acompanhadas a cada lote, para que uma classe rara que esteja rareando seja percebida enquanto ainda dá tempo de corrigir.
  • Spans aninhados e sobrepostos validados contra as regras de aninhamento da taxonomia, em vez de aceitos às cegas.
  • Um gold set anotado por revisores sêniores e reexecutado periodicamente para detectar desvio ao longo de um projeto longo.
  • Toda divergência arbitrada é escrita de volta na diretriz como exemplo comentado.

FAQ

Sobre anotação de NLP em japonês

As perguntas que surgem quando se define o escopo de um projeto de anotação de spans em japonês.

O que o seu pipeline usar — MeCab com IPAdic ou UniDic, Sudachi, Juman++ ou um tokenizador de subpalavras do seu próprio modelo. Fixamos isso no kickoff porque as fronteiras de span só se alinham a uma segmentação, e armazenamos offsets de caractere por baixo, de modo que uma troca posterior de analisador seja uma reexportação, e não uma reanotação.

Sim, e preferimos adotar o seu a impor o nosso. O que faremos é primeiro testá-lo sob pressão em uma amostra: as taxonomias existentes costumam ter duas ou três categorias que, na prática, acabam se sobrepondo, e descobrir isso durante um piloto é bem mais barato do que descobrir depois de cinquenta mil itens.

Depende inteiramente da tarefa. Tipos de entidade bem delimitados em texto limpo alcançam alta concordância rapidamente; sentimento por aspecto e taxonomias de intenção de granularidade fina, não — e um projeto que afirme o contrário costuma estar medindo algo mais fácil do que aquilo que entrega. Reportamos o número real por rótulo obtido no piloto e, se uma categoria não conseguir atingir uma concordância utilizável, dizemos isso e propomos mudar a categoria.

Sim, quando a taxonomia realmente precisa delas — substantivos compostos e nomes de organizações em japonês são a razão habitual. As regras de aninhamento são escritas na diretriz e validadas automaticamente, porque um aninhamento permitido mas não especificado é uma fonte segura de inconsistência.

Sim. Corrigir a saída do modelo é eficiente em trabalhos de alto volume, com a mesma ressalva de sempre: as passagens de correção tendem a herdar os pontos cegos do modelo. Medimos a passagem de correção contra uma amostra feita do zero, para que você saiba o que ela está de fato pegando, e para conjuntos de avaliação anotamos do zero.

Texto e NLP

Traga a taxonomia. Nós achamos os casos-limite dela.

Envie um conjunto de rótulos e uma amostra de texto real em japonês. Anotamos um piloto, reportamos a concordância de fronteira e de rótulo e dizemos quais categorias não vão se sustentar em volume.

NDA antes de você compartilhar qualquer dado. A definição do escopo do piloto é gratuita.