NLP en japonés

Anotación NLP en japonés — entidades, relaciones y clasificación

Reconocimiento de entidades nombradas, extracción de relaciones, clasificación de intención y de tema, sentimiento, inferencia en lenguaje natural y segmentación, anotados con el tokenizador que su pipeline usa realmente.

El japonés no separa las palabras con espacios. Por eso toda anotación de tramos depende de una decisión de límites que alguien tiene que tomar, y esa decisión debe coincidir con el tokenizador que viene después o las etiquetas no encajarán.

Los límites son todo el problema

En inglés, «Toyota Motor Corporation» tiene tres tokens evidentes y la única duda es dónde empieza y dónde acaba la entidad. En japonés, 株式会社トヨタ自動車 es una cadena continua, y existen al menos cuatro anotaciones defendibles: con o sin 株式会社, con o sin 自動車, tratando todo el conjunto como una sola entidad, o anidando una más corta dentro de otra más larga.

Todas ellas son opciones legítimas. Lo que importa es que se tome siempre la misma, que quede por escrito y que sobreviva al contacto con el tokenizador que usa su modelo, porque un límite de tramo que cae en mitad de un token no se puede representar en etiquetado BIO sin desplazarse en silencio.

Por eso fijamos el tokenizador y las reglas de límites antes de empezar a anotar, y por eso anotamos desplazamientos de carácter por debajo del formato de etiquetas que usted prefiera, de modo que los datos se puedan volver a tokenizar más adelante sin volver a anotarlos.

De un vistazo

Tipos de tarea
NER, extracción de relaciones y de eventos, clasificación de intención y de tema, sentimiento y emoción, NLI y paráfrasis, segmentación y normalización.
Consciente del tokenizador
Tramos anotados contra MeCab, Sudachi, Juman++ o el propio tokenizador de su modelo, según se acuerde en la reunión inicial.
Reglas de límites
Los sufijos societarios, los sustantivos compuestos, los prefijos honoríficos y la flexión están cubiertos por reglas escritas.
Salida habitual
JSONL con desplazamientos de carácter; también admitimos CoNLL-U, etiquetado BIO y brat standoff.
Revisión
Los límites de los tramos y sus etiquetas se revisan como criterios separados.

Tipos de tarea

Qué anotamos

Las tareas de tramos y las de documento tienen modos de fallo distintos, así que reciben criterios de revisión distintos.

Reconocimiento de entidades nombradas

Tramos de entidad conforme a una taxonomía definida para su dominio, incluidas las entidades anidadas y solapadas cuando las necesita.

  • Tipos estándar y propios del dominio
  • Tramos anidados y discontinuos
  • Normalización a formas canónicas
  • Vinculación de lecturas y variantes

Extracción de relaciones y eventos

Cómo se conectan las entidades: quién hizo qué a quién, qué valor pertenece a qué campo, qué cláusula modifica a qué término.

  • Relaciones binarias y n-arias
  • Disparadores y argumentos de eventos
  • Relaciones entre oraciones
  • Marcado de negación e incertidumbre

Clasificación

Intención, tema, categoría de enrutamiento o etiqueta de política, a nivel de enunciado o de documento, con una etiqueta o con varias.

  • Intención y acto de diálogo
  • Categorías de tema y de enrutamiento
  • Taxonomías multietiqueta
  • Tratamiento de lo fuera de alcance y lo poco claro

Sentimiento y emoción

Polaridad y emoción a nivel de documento, de oración o de aspecto: este último es donde el texto empresarial japonés lo necesita de verdad.

  • Polaridad de documento y de oración
  • Sentimiento basado en aspectos
  • Categorías de emoción
  • Anotación de cortesía y de registro

Inferencia y similitud

Pares de implicación, de paráfrasis y de similitud semántica, más los negativos difíciles que hacen que un conjunto de evaluación discrimine.

  • Pares de implicación para NLI
  • Identificación de paráfrasis
  • Puntuaciones graduadas de similitud
  • Construcción de negativos difíciles

Específico del japonés

Las reglas que una directriz japonesa tiene que contener

Estas cuatro preguntas surgen en la primera hora de cualquier proyecto de anotación de tramos en japonés.

Límites de palabra

El japonés se escribe sin espacios, así que un límite de tramo es una decisión de criterio y no una consulta. Distintos analizadores morfológicos segmentan la misma frase de forma distinta, y las etiquetas alineadas con uno no encajarán con otro.

Cómo lo abordamos El analizador y el diccionario se fijan en la reunión inicial, los tramos se guardan como desplazamientos de carácter para que sobrevivan a una nueva tokenización, y las convenciones de límites se enuncian con ejemplos resueltos.

Nombres de empresas y organizaciones

株式会社 puede preceder o seguir al nombre de una empresa, aparecer abreviado como (株) u omitirse por completo. Que esté dentro del tramo de la entidad cambia todas las coincidencias de cadena posteriores.

Cómo lo abordamos Una única regla cubre los prefijos y sufijos de forma jurídica, las abreviaturas y las variantes entre paréntesis, y se registra una forma canónica junto al tramo superficial.

Sustantivos compuestos

El japonés encadena sustantivos sin separadores: 個人情報保護管理者 es una sola cadena que contiene al menos tres unidades con significado. Dónde termina la entidad es una decisión, no un hecho.

Cómo lo abordamos La directriz fija una política de tramo máximo o de tramo mínimo para cada tipo de entidad, con anidamiento cuando ambos son realmente necesarios, en lugar de dejar que elija cada anotador.

Flexión y partículas adheridas

Los verbos y los adjetivos se flexionan, y las partículas se adhieren directamente a las palabras que marcan. Incluirlas o excluirlas desplaza los límites de los tramos uno o dos caracteres a lo largo de todo el corpus.

Cómo lo abordamos Las terminaciones flexivas y las partículas adheridas entran o salen del tramo por regla explícita, y una comprobación automática señala los tramos que terminan dentro de un token.

Proceso

Cómo se ejecuta un proyecto de NLP

La mayor parte del valor se crea antes de empezar a anotar, en la taxonomía y en las reglas de límites.

  1. 01

    Fijar la taxonomía y el tokenizador

    Acordamos el conjunto de etiquetas, el analizador y el diccionario, y cómo se representarán los tramos, para que la anotación encaje con el pipeline al que va destinada.

  2. 02

    Encontrar los casos límite

    Se anota una muestra pequeña para sacar a la luz las construcciones realmente ambiguas de su dominio. Esas construcciones se convierten en los ejemplos resueltos de la directriz.

  3. 03

    Calibrar y medir el acuerdo

    Los anotadores etiquetan el mismo conjunto de forma independiente. El acuerdo se mide por separado en límites y en etiquetas, porque fallan por razones distintas.

  4. 04

    Anotar y arbitrar

    Anotación de producción con una pasada de revisión y arbitraje por escrito de las discrepancias, que se incorpora directamente a la directriz.

  5. 05

    Entregar con desplazamientos

    Los datos se entregan con desplazamientos de carácter y el formato de etiquetas que haya elegido, la versión de la taxonomía, los recuentos por etiqueta y el informe de QA.

Entrega

Formatos y representación

Los desplazamientos de carácter se incluyen siempre, sea cual sea el formato superficial que elija, de modo que los datos se pueden volver a tokenizar sin volver a anotarlos.

Formatos de salida habituales para la anotación NLP en japonés.
TareaSalida por defectoTambién disponible
Entidades nombradasJSONL con desplazamientos de carácterCoNLL-U, BIO / BILOU, brat standoff
Relaciones y eventosJSONL con referencias a tramosbrat standoff, JSON de grafo propio
ClasificaciónJSONL o CSVmatrices one-hot o multietiqueta
SentimientoJSONL con tramos de aspectoCSV, etiquetas por oración
NLI y similitudPares en JSONLCSV, TSV con la disposición de un benchmark

Calidad

Controles propios de este trabajo

Un conjunto de datos de tramos puede tener una exactitud de etiquetas excelente y unos límites inservibles. Medimos ambas cosas.

  • Acuerdo de límites y acuerdo de etiquetas comunicados como cifras separadas.
  • Validación automática de que ningún tramo termina dentro de un token bajo el analizador acordado.
  • Recuentos por etiqueta controlados en cada lote, para advertir que una clase rara se está quedando sin ejemplos mientras aún se puede corregir.
  • Tramos anidados y solapados validados contra las reglas de anidamiento de la taxonomía en lugar de aceptarse sin más.
  • Un gold set anotado por revisores sénior y repetido de forma periódica para detectar la deriva en un proyecto largo.
  • Cada discrepancia arbitrada se incorpora a la directriz como ejemplo resuelto.

FAQ

Sobre la anotación NLP en japonés

Las preguntas que surgen cuando se acota un proyecto de anotación de tramos en japonés.

El que use su pipeline: MeCab con IPAdic o UniDic, Sudachi, Juman++ o un tokenizador de subpalabras de su propio modelo. Lo fijamos en la reunión inicial porque los límites de los tramos solo encajan con una segmentación, y guardamos los desplazamientos de carácter por debajo, de modo que cambiar de analizador más adelante sea una reexportación y no una reanotación.

Sí, y preferimos adoptar el suyo antes que imponer el nuestro. Lo que sí haremos es someterlo primero a prueba con una muestra: las taxonomías existentes suelen tener dos o tres categorías que en la práctica acaban solapándose, y descubrirlo durante un piloto sale mucho más barato que descubrirlo tras cincuenta mil ítems.

Depende enteramente de la tarea. Los tipos de entidad nítidos sobre texto limpio alcanzan pronto un acuerdo alto; el sentimiento basado en aspectos y las taxonomías de intención de grano fino no lo hacen, y un proyecto que afirme lo contrario suele estar midiendo algo más fácil que lo que entrega. Comunicamos la cifra real por etiqueta obtenida en el piloto, y si una categoría no alcanza un acuerdo utilizable lo diremos y propondremos cambiar la categoría.

Sí, cuando la taxonomía las necesita de verdad: los sustantivos compuestos y los nombres de organización japoneses son el motivo habitual. Las reglas de anidamiento se escriben en la directriz y se validan automáticamente, porque un anidamiento permitido pero no especificado es una fuente segura de incoherencia.

Sí. Corregir la salida de un modelo es eficiente en trabajos de gran volumen, con la misma salvedad de siempre: las pasadas de corrección tienden a heredar los puntos ciegos del modelo. Medimos la pasada de corrección contra una muestra anotada desde cero para que usted sepa qué está detectando realmente, y los conjuntos de evaluación los anotamos desde cero.

Texto y NLP

Traiga la taxonomía. Nosotros encontraremos sus casos límite.

Envíenos un conjunto de etiquetas y una muestra de texto real en japonés. Anotamos un piloto, comunicamos el acuerdo de límites y de etiquetas, y le decimos qué categorías no aguantarán a volumen.

NDA antes de que comparta ningún dato. La definición del piloto no tiene coste.