Servicios

Datos de entrenamiento de IA en japonés, en todas las modalidades

Cinco servicios que cubren lo que un sistema de IA necesita en cada etapa: desde los datos de instrucciones que enseñan al modelo hasta la evaluación humana que le dice si ha funcionado.

Los cinco se apoyan en la misma base: anotadores en Japón, directrices versionadas en lugar de memorizadas y una calidad que se mide antes de afirmarse.

Un solo equipo para todo el ciclo de vida del dato

La mayoría de los problemas de anotación no son problemas de etiquetado, sino de definición: dos personas razonables leen la misma directriz y etiquetan de forma distinta la misma frase en japonés, y nadie se da cuenta hasta que el modelo se entrena con ambas. Dividir nuestro trabajo en cinco servicios es una manera de hacer explícitas esas definiciones: cada servicio tiene sus propias preguntas de taxonomía, sus propios modos de fallo y sus propios controles de calidad.

Los servicios no son paquetes entre los que haya que elegir. Un mismo proyecto usa habitualmente tres: anotación NLP para construir un corpus etiquetado, datos de entrenamiento para LLM que lo convierten en pares de instrucción y de preferencia, y evaluación para medir qué hace realmente el modelo resultante. Lo que no cambia es el criterio sobre la lengua japonesa que hay debajo de todo ello.

De un vistazo

Modalidades
Datos en japonés de texto, voz, imagen, vídeo, documentos y multimodales.
Etapas del modelo
Filtrado del corpus, ajuste fino supervisado, datos de preferencia y RLHF, evaluación y benchmarking.
Formatos de entrega
JSONL, CSV, CoNLL-U, SRT, CTM, COCO — o el esquema que usted defina.
Herramientas
Trabajamos dentro de su plataforma de anotación o en nuestro propio entorno seguro.
Punto de partida
Un piloto acotado. La taxonomía y la calidad se demuestran antes de aumentar el volumen.

Qué hacemos

Cinco servicios, más la capa experta

Cada uno tiene su propia página, con las decisiones de taxonomía, las trampas propias del japonés y los entregables detallados.

Datos para LLM

Conjuntos de datos de instrucciones, de preferencia y de RLHF escritos en japonés, con las decisiones de registro tomadas de forma explícita.

  • Datos de instrucciones y SFT
  • Datos de preferencia y ordenación
  • Diálogo multiturno
  • Datos de seguridad, rechazo y red teaming
Ver el servicio

Evaluación de LLM

Evaluación humana de la salida de un modelo en japonés — rúbricas, preferencia por pares, factualidad y red teaming.

  • Preferencia por pares
  • Puntuación con rúbrica
  • Factualidad y grounding
  • Seguridad y red teaming
Ver el servicio

Voz y audio

Transcripción ASR, diarización y etiquetado de intención en japonés, con la convención de normalización puesta por escrito.

  • Transcripción
  • Sincronización y alineamiento
  • Etiquetado de hablantes
  • Etiquetado de intención y slots
Ver el servicio

Imagen y vídeo

Cajas delimitadoras, segmentación, OCR y maquetación de documentos sobre imágenes, vídeo y documentación en japonés.

  • Detección y segmentación
  • Puntos clave y atributos
  • Anotación de vídeo
  • OCR y maquetación de documentos
Ver el servicio

Texto y NLP

Entidades, relaciones, intención y sentimiento sobre texto en japonés, con los límites del tokenizador decididos y no supuestos.

  • Reconocimiento de entidades nombradas
  • Extracción de relaciones y eventos
  • Clasificación
  • Sentimiento y emoción
Ver el servicio

Anotación experta

Anotación y evaluación con especialistas japoneses de cada ámbito, para IA que opera en sectores regulados.

  • Abogados
  • Asesores fiscales
  • Contables públicos certificados
  • Especialistas laborales y de seguridad social
Ver el servicio

Cómo elegir

¿Qué servicio necesito?

Parta de lo que quiere cambiar en el modelo. El servicio se deduce de ahí, no del tipo de archivo que tenga a mano.

Correspondencia entre objetivo y servicio. La mayoría de los programas acaban combinando dos o tres.
Si su objetivo es…El servicio esPrimer entregable habitual
Que el modelo responda en un japonés natural y con el registro correctoDatos para LLMUn conjunto piloto de pares instrucción–respuesta con una guía de estilo cerrada
Descubrir dónde se equivoca el modelo antes de lanzarloEvaluación de LLMUn conjunto de evaluación puntuado, con rúbrica y acuerdo entre evaluadores
Que el modelo reconozca con precisión el habla en japonésVoz y audioAudio transcrito con una convención de normalización escrita
Leer documentos, formularios o texto en pantalla en japonésImagen y vídeoAnotación de OCR y de maquetación sobre una muestra representativa de documentos
Extraer datos estructurados de texto en japonésTexto y NLPUn esquema de entidades y relaciones probado contra casos límite reales
Que especialistas valoren respuestas en un sector reguladoAnotación expertaUn conjunto de evaluación revisado por expertos, con notas de arbitraje por escrito

Ciclo de vida

Dónde encaja cada servicio

Rara vez un mismo conjunto de datos sirve para dos etapas. Los datos creados para enseñar a un modelo son una mala prueba para él, porque el modelo ya los ha visto.

  1. 01

    Preparación del corpus

    Filtrado, reglas de deduplicación y marcas de calidad y seguridad sobre texto, voz o documentos en japonés sin procesar. Determina qué merece la pena anotar.

  2. 02

    Ajuste fino supervisado

    Pares instrucción–respuesta, diálogo multiturno y demostraciones de tareas, escritos en el registro que el producto usa realmente.

  3. 03

    Preferencia y alineamiento

    Comparaciones ordenadas o por pares, comportamiento de seguridad y de rechazo, y los criterios escritos que hacen que una respuesta sea mejor que otra.

  4. 04

    Evaluación

    Conjuntos reservados y puntuación con rúbrica a cargo de personas que no participaron en la creación de los datos de entrenamiento, de modo que la medición sea independiente.

  5. 05

    Monitorización en producción

    Muestreo de la salida del modelo en producción, puntuación con la misma rúbrica e incorporación de los fallos recurrentes al siguiente ciclo de datos.

Entrega

Formatos y entrega

Cada lote se entrega con la versión de la taxonomía con la que se etiquetó y un registro de cambios respecto al lote anterior, de modo que los conjuntos de datos siguen siendo comparables entre versiones.

Formatos de entrega habituales. Los esquemas propios se definen en la reunión inicial y se versionan junto con los datos.
Tipo de datoEntrega habitualTambién disponible
Texto y NLPJSONLCSV, CoNLL-U, brat standoff, Parquet
Instrucción y preferencia para LLMJSONL (messages / chosen–rejected)CSV, formato de dataset de Hugging Face
VozJSON con marcas de tiempoSRT, VTT, CTM, TextGrid, transcripción en texto plano
Imagen y vídeoCOCO JSONYOLO, Pascal VOC, CVAT XML, JSONL por fotograma
Documentos y OCRJSON con geometría de páginahOCR, ALTO, extracción de campos en CSV
Resultados de evaluaciónPuntuaciones en JSONL más un informe de QACSV, cuaderno de puntuación, registro de arbitraje

FAQ

Sobre los servicios

Preguntas de alcance y de proceso que surgen antes de definir un piloto.

Sí, y la mayoría de los programas lo hacen. Una secuencia habitual es anotación NLP para establecer un corpus etiquetado, datos de entrenamiento para LLM construidos a partir de él y, después, una evaluación ejecutada por un grupo distinto de anotadores. Reunirlos en una sola colaboración hace que la taxonomía, la guía de estilo y las métricas de QA se mantengan coherentes, en lugar de volver a deducirse con cada proveedor.

El japonés es aquello para lo que estamos hechos, y el trabajo bilingüe japonés–inglés forma parte de ello. Para trabajo de volumen en otros idiomas preferimos decirle con claridad que no somos el proveedor adecuado antes que aceptar el proyecto y subcontratarlo.

El precio es por unidad de trabajo — por ítem, por hora de audio, por imagen o por evaluación — y depende de la complejidad de la tarea, del tiempo de revisión que exige cada ítem y del nivel de especialización necesario. Presupuestamos después de acotar un piloto sobre sus datos reales, porque un presupuesto basado en la descripción de una tarea es una conjetura, y normalmente una conjetura equivocada.

Nosotros las redactamos, usted las revisa, y ambas cosas ocurren antes de la producción. El piloto existe para romper el primer borrador con casos límite reales; cada discrepancia resuelta durante el piloto se incorpora al documento. Después la directriz se versiona, y cada lote entregado deja constancia de con qué versión se etiquetó.

Empiece aquí

Cuéntenos qué necesita aprender el modelo.

Envíenos la tarea, una muestra de datos y las restricciones con las que trabaja. Le devolvemos un plan de piloto acotado, las preguntas de taxonomía que necesitaríamos resolver y una visión honesta de lo que resulta difícil.

NDA antes de que comparta ningún dato. La definición del piloto no tiene coste.