Visión y multimodal

Anotación de imagen, vídeo y documentos en japonés

Cajas delimitadoras, polígonos, segmentación, puntos clave, seguimiento en vídeo, OCR y maquetación de documentos, sobre datos en los que el texto de la imagen está en japonés y los documentos siguen las convenciones empresariales japonesas.

Casi toda la anotación de visión es independiente del idioma. En cuanto hay texto en el encuadre, o un formulario japonés en la página, deja de serlo muy deprisa.

En qué se diferencian los datos de visión japoneses

Dibujar una caja alrededor de un coche es el mismo trabajo en cualquier país. Leer el texto de un recibo japonés, no. Los documentos japoneses discurren en vertical con la misma frecuencia que en horizontal, mezclan cuatro sistemas de escritura dentro de una misma línea, usan caracteres latinos y cifras de ancho completo, llevan furigana encima de las palabras que glosan y colocan un sello de empresa donde un formulario occidental espera una firma.

Los proyectos de IA documental fracasan por estos detalles antes que por el modelo. Una anotación de maquetación que trata una columna vertical como cinco líneas separadas, o una transcripción OCR que convierte en silencio las cifras de ancho completo a ancho medio, produce datos de entrenamiento que enseñan al modelo algo distinto de lo que usted pretendía.

Lo mismo ocurre con el texto en pantalla y en entornos reales: la rotulación comercial, los envases de producto, las cartas de restaurante y los paneles de estación están llenos de tipografía japonesa que las directrices de anotación genéricas sencillamente no contemplan.

De un vistazo

Tipos de tarea
Detección, segmentación, puntos clave, clasificación, seguimiento en vídeo, transcripción OCR, maquetación de documentos y extracción de campos.
Trabajo documental
Facturas, recibos, pedidos de compra, contratos, formularios de solicitud, anotaciones manuscritas y material con texto vertical.
Tratamiento del japonés
Texto vertical, furigana, escrituras mezcladas, caracteres de ancho completo y convenciones de los formularios japoneses.
Salida habitual
COCO JSON; también admitimos YOLO, Pascal VOC, CVAT XML, hOCR y ALTO.
Revisión
La geometría y la etiqueta se revisan por separado, porque fallan de maneras distintas.

Tipos de tarea

Qué anotamos

La geometría, la categoría y el texto son capas separadas, y se revisan por separado.

Detección y segmentación

Cajas delimitadoras, cajas rotadas, polígonos y máscaras a nivel de píxel conforme a una taxonomía de clases acordada antes de la producción.

  • Cajas delimitadoras 2D y rotadas
  • Segmentación por polígonos y de instancias
  • Segmentación semántica
  • Marcas de oclusión y truncamiento

Puntos clave y atributos

Colocación de puntos de referencia y atributos por objeto para pose, estado del producto, valoración del estado de conservación y trabajos de grano fino similares.

  • Puntos clave de esqueleto y de referencia
  • Conjuntos de atributos por objeto
  • Clasificación de grano fino
  • Marcas de visibilidad por punto

Anotación de vídeo

Seguimiento de objetos entre fotogramas con identidades estables, más segmentación temporal de acciones y eventos.

  • Identificadores de seguimiento multiobjeto
  • Tramos de acciones y eventos
  • Revisión de la interpolación entre fotogramas
  • Reidentificación tras una oclusión

OCR y maquetación de documentos

Detección de regiones de texto, orden de lectura, transcripción y roles estructurales en documentos empresariales japoneses.

  • Detección de líneas y regiones de texto
  • Orden de lectura en maquetación vertical y mixta
  • Transcripción con una regla de normalización
  • Regiones de tabla, encabezado y sello

Extracción de campos y relaciones

Convertir un documento en valores estructurados: qué texto es el total, qué fecha es la de emisión, qué líneas de detalle van juntas.

  • Etiquetado de campos clave–valor
  • Agrupación de líneas de detalle en tablas
  • Relaciones entre páginas
  • Marcas de confianza y de ambigüedad

Específico del japonés

Lo que se le escapa a una directriz de visión genérica

Cuatro puntos de fallo recurrentes en datos japoneses de imagen y de documentos.

Texto vertical y orden de lectura

El japonés se lee de arriba abajo y de derecha a izquierda, además de izquierda a derecha, y una misma página mezcla a menudo ambas direcciones. Las herramientas que dan por hecho que las líneas son horizontales producen un orden de lectura equivocado y muy seguro de sí mismo.

Cómo lo abordamos El orden de lectura se anota de forma explícita en lugar de deducirse de la geometría, con reglas para las páginas de orientación mixta, el texto ruby y la maquetación a varias columnas.

Furigana y texto ruby

Los kana pequeños impresos encima o al lado de una palabra en kanji son una glosa de pronunciación, no contenido adicional. Transcritos en línea, corrompen el texto; descartados sin más, se pierde información que quizá necesite.

Cómo lo abordamos El ruby se recoge como una anotación vinculada a su texto base, de modo que después se puede conservar, descartar o usar como etiqueta de lectura sin volver a anotar.

Caracteres de ancho completo y de ancho medio

A123 y A123 parecen casi idénticos y son caracteres distintos. Una normalización sin control en este punto es uno de los defectos silenciosos más habituales en los conjuntos de datos de OCR en japonés.

Cómo lo abordamos La convención de transcripción indica exactamente qué caracteres se normalizan y cuáles se conservan, y una comprobación automática lo hace cumplir antes de la entrega.

Convenciones de los formularios japoneses

Las facturas, los recibos y las solicitudes japonesas tienen su propio vocabulario estructural — 御中, 但し書き, sellos de empresa, fechas basadas en la era, totales con y sin impuestos uno al lado del otro.

Cómo lo abordamos El esquema de campos se construye sobre ejemplos reales de sus tipos de documento, con las fechas de era, las regiones de sello y el tratamiento fiscal definidos como campos de primer nivel y no como texto libre.

Proceso

Cómo se ejecuta un proyecto de visión

La taxonomía y las reglas de geometría se cierran sobre una muestra real antes de que nadie anote a volumen.

  1. 01

    Muestrear y definir la taxonomía

    Anotamos un conjunto pequeño y representativo para encontrar los casos ambiguos: qué cuenta como un objeto, qué pasa en el borde del encuadre, cuándo una clase es realmente dudosa.

  2. 02

    Escribir las reglas de geometría

    El ajuste de las cajas, el tratamiento de la oclusión, el tamaño mínimo de objeto, el truncamiento, los objetos agrupados y el tratamiento del texto ilegible quedan fijados por escrito.

  3. 03

    Calibrar

    Varios anotadores etiquetan las mismas imágenes de forma independiente. Se mide el acuerdo geométrico, y donde es bajo la regla era ambigua.

  4. 04

    Anotar y revisar

    La geometría y las etiquetas se revisan en pasadas separadas, porque una caja ajustada sobre la clase equivocada y una caja floja sobre la clase correcta son defectos distintos.

  5. 05

    Entregar e informar

    Las anotaciones se entregan en su formato, con la versión de la taxonomía, los recuentos por clase y el informe de QA del lote.

Entrega

Formatos de entrada y de salida

Exportamos al formato nativo de su pipeline de entrenamiento en lugar de obligarle a escribir un conversor.

Formatos de salida habituales en el trabajo de imagen, vídeo y documentos.
TareaSalida por defectoTambién disponible
Detección y segmentaciónCOCO JSONYOLO, Pascal VOC, CVAT XML, máscaras en PNG
Puntos clave y atributosCOCO keypoints JSONCSV, esquema JSON propio
Seguimiento en vídeoFormato MOTCOCO por fotograma, CVAT XML
OCR y maquetaciónJSON con geometría de páginahOCR, ALTO, PAGE XML
Extracción de camposJSONL, un documento por líneaCSV, su esquema de IA documental

Calidad

Controles propios de este trabajo

Los defectos de visión se esconden bien. Estas comprobaciones son las que los sacan a la luz antes de que lo haga el entrenamiento.

  • Acuerdo geométrico medido sobre una muestra reanotada, comunicado por separado del acuerdo de etiquetas.
  • Comprobaciones automáticas de cajas degeneradas, duplicados superpuestos y objetos fuera de los límites de la imagen.
  • Orden de lectura y vinculación del ruby validados en todas las páginas de documento, no por muestreo.
  • Normalización de ancho completo y ancho medio aplicada automáticamente conforme a la convención escrita.
  • Identidades de seguimiento comprobadas a lo largo de todo el clip, de modo que un intercambio de identidades tras una oclusión se detecta.
  • Recuentos por clase revisados en cada lote, para advertir a tiempo si una clase desaparece de los datos sin que nadie lo note.

FAQ

Sobre imagen, vídeo y documentos

Preguntas habituales sobre el trabajo de visión e IA documental en japonés.

Sí: entradas manuscritas en formularios, direcciones, nombres y comentarios de texto libre. La escritura a mano es más lenta y tiene una tasa de ambigüedad realmente mayor que la impresa, así que marcamos los caracteres dudosos en lugar de adivinarlos, y acordamos de antemano si un campo ilegible se transcribe según el mejor criterio posible o se marca como ilegible. Esa decisión importa más para su modelo que la cifra bruta de exactitud.

Sí. Trabajamos dentro de las plataformas que facilita el cliente — CVAT, Label Studio, SageMaker Ground Truth, Labelbox y herramientas internas, entre otras — o en nuestro propio entorno seguro cuando prefiere no dar de alta cuentas. La plataforma que usemos no cambia la directriz ni el proceso de revisión.

Sí, y en trabajos de detección de gran volumen suele ser el enfoque sensato. El riesgo es que las pasadas de corrección hereden los puntos ciegos del modelo, así que medimos la pasada de corrección contra una muestra anotada desde cero y le decimos qué está detectando realmente. Con el OCR de documentos japoneses somos más prudentes, porque los errores del modelo en caracteres de ancho completo y en texto vertical son fáciles de pasar por alto en pantalla.

Bajo NDA y un acuerdo de tratamiento de datos, en un entorno aislado y con el acceso limitado a las personas asignadas al proyecto. También podemos anotar la información personal para su anonimización, o trabajar únicamente sobre material que usted haya anonimizado antes de enviarlo. Las condiciones de retención y borrado se acuerdan en el contrato en lugar de dejarse a una política interna.

Los documentos japoneses usan habitualmente años de era — 令和6年 en lugar de 2024 — y a menudo mezclan ambos en la misma página. Tratamos la fecha de era como un campo propio, conservando la cadena original, más un valor gregoriano normalizado cuando usted lo desea, de modo que no se pierde información en la conversión ni queda ningún error de conversión incrustado en los datos.

Imagen y vídeo

Envíenos una página, un fotograma o una carpeta.

Una muestra representativa de sus documentos o grabaciones reales nos basta para redactar una taxonomía, anotar un conjunto piloto y decirle dónde estará la ambigüedad.

NDA antes de que comparta ningún dato. La definición del piloto no tiene coste.