Servicios
Datos de entrenamiento de IA en japonés, en todas las modalidades
Cinco servicios que cubren lo que un sistema de IA necesita en cada etapa: desde los datos de instrucciones que enseñan al modelo hasta la evaluación humana que le dice si ha funcionado.
Los cinco se apoyan en la misma base: anotadores en Japón, directrices versionadas en lugar de memorizadas y una calidad que se mide antes de afirmarse.
Un solo equipo para todo el ciclo de vida del dato
La mayoría de los problemas de anotación no son problemas de etiquetado, sino de definición: dos personas razonables leen la misma directriz y etiquetan de forma distinta la misma frase en japonés, y nadie se da cuenta hasta que el modelo se entrena con ambas. Dividir nuestro trabajo en cinco servicios es una manera de hacer explícitas esas definiciones: cada servicio tiene sus propias preguntas de taxonomía, sus propios modos de fallo y sus propios controles de calidad.
Los servicios no son paquetes entre los que haya que elegir. Un mismo proyecto usa habitualmente tres: anotación NLP para construir un corpus etiquetado, datos de entrenamiento para LLM que lo convierten en pares de instrucción y de preferencia, y evaluación para medir qué hace realmente el modelo resultante. Lo que no cambia es el criterio sobre la lengua japonesa que hay debajo de todo ello.
De un vistazo
- Modalidades
- Datos en japonés de texto, voz, imagen, vídeo, documentos y multimodales.
- Etapas del modelo
- Filtrado del corpus, ajuste fino supervisado, datos de preferencia y RLHF, evaluación y benchmarking.
- Formatos de entrega
- JSONL, CSV, CoNLL-U, SRT, CTM, COCO — o el esquema que usted defina.
- Herramientas
- Trabajamos dentro de su plataforma de anotación o en nuestro propio entorno seguro.
- Punto de partida
- Un piloto acotado. La taxonomía y la calidad se demuestran antes de aumentar el volumen.
Qué hacemos
Cinco servicios, más la capa experta
Cada uno tiene su propia página, con las decisiones de taxonomía, las trampas propias del japonés y los entregables detallados.
Datos para LLM
Conjuntos de datos de instrucciones, de preferencia y de RLHF escritos en japonés, con las decisiones de registro tomadas de forma explícita.
- Datos de instrucciones y SFT
- Datos de preferencia y ordenación
- Diálogo multiturno
- Datos de seguridad, rechazo y red teaming
Evaluación de LLM
Evaluación humana de la salida de un modelo en japonés — rúbricas, preferencia por pares, factualidad y red teaming.
- Preferencia por pares
- Puntuación con rúbrica
- Factualidad y grounding
- Seguridad y red teaming
Voz y audio
Transcripción ASR, diarización y etiquetado de intención en japonés, con la convención de normalización puesta por escrito.
- Transcripción
- Sincronización y alineamiento
- Etiquetado de hablantes
- Etiquetado de intención y slots
Imagen y vídeo
Cajas delimitadoras, segmentación, OCR y maquetación de documentos sobre imágenes, vídeo y documentación en japonés.
- Detección y segmentación
- Puntos clave y atributos
- Anotación de vídeo
- OCR y maquetación de documentos
Texto y NLP
Entidades, relaciones, intención y sentimiento sobre texto en japonés, con los límites del tokenizador decididos y no supuestos.
- Reconocimiento de entidades nombradas
- Extracción de relaciones y eventos
- Clasificación
- Sentimiento y emoción
Anotación experta
Anotación y evaluación con especialistas japoneses de cada ámbito, para IA que opera en sectores regulados.
- Abogados
- Asesores fiscales
- Contables públicos certificados
- Especialistas laborales y de seguridad social
Cómo elegir
¿Qué servicio necesito?
Parta de lo que quiere cambiar en el modelo. El servicio se deduce de ahí, no del tipo de archivo que tenga a mano.
| Si su objetivo es… | El servicio es | Primer entregable habitual |
|---|---|---|
| Que el modelo responda en un japonés natural y con el registro correcto | Datos para LLM | Un conjunto piloto de pares instrucción–respuesta con una guía de estilo cerrada |
| Descubrir dónde se equivoca el modelo antes de lanzarlo | Evaluación de LLM | Un conjunto de evaluación puntuado, con rúbrica y acuerdo entre evaluadores |
| Que el modelo reconozca con precisión el habla en japonés | Voz y audio | Audio transcrito con una convención de normalización escrita |
| Leer documentos, formularios o texto en pantalla en japonés | Imagen y vídeo | Anotación de OCR y de maquetación sobre una muestra representativa de documentos |
| Extraer datos estructurados de texto en japonés | Texto y NLP | Un esquema de entidades y relaciones probado contra casos límite reales |
| Que especialistas valoren respuestas en un sector regulado | Anotación experta | Un conjunto de evaluación revisado por expertos, con notas de arbitraje por escrito |
Ciclo de vida
Dónde encaja cada servicio
Rara vez un mismo conjunto de datos sirve para dos etapas. Los datos creados para enseñar a un modelo son una mala prueba para él, porque el modelo ya los ha visto.
-
01
Preparación del corpus
Filtrado, reglas de deduplicación y marcas de calidad y seguridad sobre texto, voz o documentos en japonés sin procesar. Determina qué merece la pena anotar.
-
02
Ajuste fino supervisado
Pares instrucción–respuesta, diálogo multiturno y demostraciones de tareas, escritos en el registro que el producto usa realmente.
-
03
Preferencia y alineamiento
Comparaciones ordenadas o por pares, comportamiento de seguridad y de rechazo, y los criterios escritos que hacen que una respuesta sea mejor que otra.
-
04
Evaluación
Conjuntos reservados y puntuación con rúbrica a cargo de personas que no participaron en la creación de los datos de entrenamiento, de modo que la medición sea independiente.
-
05
Monitorización en producción
Muestreo de la salida del modelo en producción, puntuación con la misma rúbrica e incorporación de los fallos recurrentes al siguiente ciclo de datos.
Entrega
Formatos y entrega
Cada lote se entrega con la versión de la taxonomía con la que se etiquetó y un registro de cambios respecto al lote anterior, de modo que los conjuntos de datos siguen siendo comparables entre versiones.
| Tipo de dato | Entrega habitual | También disponible |
|---|---|---|
| Texto y NLP | JSONL | CSV, CoNLL-U, brat standoff, Parquet |
| Instrucción y preferencia para LLM | JSONL (messages / chosen–rejected) | CSV, formato de dataset de Hugging Face |
| Voz | JSON con marcas de tiempo | SRT, VTT, CTM, TextGrid, transcripción en texto plano |
| Imagen y vídeo | COCO JSON | YOLO, Pascal VOC, CVAT XML, JSONL por fotograma |
| Documentos y OCR | JSON con geometría de página | hOCR, ALTO, extracción de campos en CSV |
| Resultados de evaluación | Puntuaciones en JSONL más un informe de QA | CSV, cuaderno de puntuación, registro de arbitraje |
FAQ
Sobre los servicios
Preguntas de alcance y de proceso que surgen antes de definir un piloto.
Sí, y la mayoría de los programas lo hacen. Una secuencia habitual es anotación NLP para establecer un corpus etiquetado, datos de entrenamiento para LLM construidos a partir de él y, después, una evaluación ejecutada por un grupo distinto de anotadores. Reunirlos en una sola colaboración hace que la taxonomía, la guía de estilo y las métricas de QA se mantengan coherentes, en lugar de volver a deducirse con cada proveedor.
El japonés es aquello para lo que estamos hechos, y el trabajo bilingüe japonés–inglés forma parte de ello. Para trabajo de volumen en otros idiomas preferimos decirle con claridad que no somos el proveedor adecuado antes que aceptar el proyecto y subcontratarlo.
El precio es por unidad de trabajo — por ítem, por hora de audio, por imagen o por evaluación — y depende de la complejidad de la tarea, del tiempo de revisión que exige cada ítem y del nivel de especialización necesario. Presupuestamos después de acotar un piloto sobre sus datos reales, porque un presupuesto basado en la descripción de una tarea es una conjetura, y normalmente una conjetura equivocada.
Nosotros las redactamos, usted las revisa, y ambas cosas ocurren antes de la producción. El piloto existe para romper el primer borrador con casos límite reales; cada discrepancia resuelta durante el piloto se incorpora al documento. Después la directriz se versiona, y cada lote entregado deja constancia de con qué versión se etiquetó.
Empiece aquí
Cuéntenos qué necesita aprender el modelo.
Envíenos la tarea, una muestra de datos y las restricciones con las que trabaja. Le devolvemos un plan de piloto acotado, las preguntas de taxonomía que necesitaríamos resolver y una visión honesta de lo que resulta difícil.
NDA antes de que comparta ningún dato. La definición del piloto no tiene coste.