Serviços
Dados de treinamento de IA em japonês, em todas as modalidades
Cinco serviços que cobrem o que um sistema de IA precisa em cada etapa — dos dados de instrução que ensinam o modelo à avaliação humana que diz se aquilo funcionou.
Os cinco funcionam sobre a mesma base: anotadores no Japão, diretrizes versionadas em vez de memorizadas e qualidade que é medida antes de ser afirmada.
Um time, todo o ciclo de vida dos dados
A maior parte dos problemas de anotação não é de rotulagem. É de definição: duas pessoas razoáveis leem a mesma diretriz e rotulam a mesma frase em japonês de formas diferentes, e ninguém percebe até o modelo ser treinado com as duas. Dividir o trabalho em cinco serviços é um jeito de tornar essas definições explícitas — cada serviço tem suas próprias questões de taxonomia, seus próprios modos de falha e suas próprias verificações de qualidade.
Os serviços não são pacotes entre os quais você precisa escolher. Um único projeto costuma usar três deles: anotação de NLP para construir um corpus rotulado, dados de treinamento de LLM para transformá-lo em pares de instrução e de preferência, e avaliação para medir o que o modelo resultante de fato faz. O que se mantém constante é o julgamento sobre a língua japonesa por trás de tudo isso.
Resumo
- Modalidades
- Dados em japonês de texto, fala, imagem, vídeo, documentos e multimodais.
- Etapas do modelo
- Filtragem de corpus, ajuste fino supervisionado, dados de preferência e RLHF, avaliação e benchmarking.
- Formatos de entrega
- JSONL, CSV, CoNLL-U, SRT, CTM, COCO — ou um esquema definido por você.
- Ferramentas
- Trabalhamos dentro da sua plataforma de anotação ou no nosso próprio ambiente seguro.
- Ponto de partida
- Um piloto com escopo definido. Taxonomia e qualidade são comprovadas antes de o volume crescer.
O que fazemos
Cinco serviços, mais a camada de especialistas
Cada um tem sua própria página, com as decisões de taxonomia, as armadilhas específicas do japonês e os entregáveis detalhados.
Dados para LLM
Conjuntos de instrução, de preferência e de RLHF escritos em japonês, com as decisões de registro tomadas de forma explícita.
- Dados de instrução e SFT
- Dados de preferência e de ranqueamento
- Diálogo multiturno
- Dados de segurança, recusa e red team
Avaliação de LLM
Avaliação humana da saída de modelos em japonês — rubricas, preferência pareada, factualidade e red teaming.
- Preferência pareada
- Pontuação por rubrica
- Factualidade e grounding
- Segurança e red teaming
Fala e áudio
Transcrição para ASR, diarização e rotulagem de intenção em japonês, com a convenção de normalização posta por escrito.
- Transcrição
- Tempo e alinhamento
- Rotulagem de falantes
- Rotulagem de intenção e slots
Imagem e vídeo
Caixas delimitadoras, segmentação, OCR e layout de documentos em imagens, vídeos e papelada em japonês.
- Detecção e segmentação
- Keypoints e atributos
- Anotação de vídeo
- OCR e layout de documentos
Texto e NLP
Entidades, relações, intenção e sentimento em texto japonês, com as fronteiras do tokenizador decididas em vez de presumidas.
- Reconhecimento de entidades nomeadas
- Extração de relações e eventos
- Classificação
- Sentimento e emoção
Especialistas
Anotação e avaliação com especialistas de domínio japoneses, para IA que atua em setores regulados.
- Advogados
- Contadores tributários
- Contadores públicos certificados
- Especialistas trabalhistas e previdenciários
Escolha
De qual serviço eu preciso?
Comece pelo que você quer mudar no modelo. O serviço decorre disso, e não do tipo de arquivo que você por acaso tem.
| Se o seu objetivo é… | O serviço é | Primeiro entregável típico |
|---|---|---|
| Ensinar o modelo a responder em japonês natural e no registro correto | Dados para LLM | Um conjunto piloto de pares instrução–resposta com um guia de estilo congelado |
| Descobrir onde o modelo erra antes de colocá-lo no ar | Avaliação de LLM | Um conjunto de avaliação pontuado, com rubrica e concordância entre avaliadores |
| Fazer o modelo ouvir fala em japonês com precisão | Fala e áudio | Áudio transcrito com uma convenção de normalização escrita |
| Ler documentos, formulários ou texto em tela em japonês | Imagem e vídeo | Anotação de OCR e de layout em uma amostra representativa de documentos |
| Extrair fatos estruturados de texto em japonês | Texto e NLP | Um esquema de entidades e relações testado em casos-limite reais |
| Ter especialistas julgando respostas em uma área regulada | Anotação por especialistas | Um conjunto de avaliação revisado por especialistas, com notas de arbitragem por escrito |
Ciclo de vida
Onde cada serviço se encaixa
O mesmo conjunto de dados raramente serve a duas etapas. Dados construídos para ensinar um modelo são um teste ruim dele, porque o modelo já os viu.
-
01
Preparação do corpus
Regras de filtragem e de deduplicação, sinalizadores de qualidade e de segurança sobre texto, fala ou documentos brutos em japonês. Define o que vale a pena anotar.
-
02
Ajuste fino supervisionado
Pares instrução–resposta, diálogo multiturno e demonstrações de tarefa escritos no registro que o produto de fato usa.
-
03
Preferência e alinhamento
Comparações ranqueadas ou pareadas, comportamento de segurança e de recusa, e os critérios escritos que tornam uma resposta melhor do que outra.
-
04
Avaliação
Conjuntos reservados e pontuação por rubrica feitos por pessoas que não participaram da construção dos dados de treinamento, para que a medição seja independente.
-
05
Monitoramento em produção
Amostrar a saída do modelo em produção, pontuá-la com a mesma rubrica e devolver as falhas recorrentes ao ciclo de dados seguinte.
Entrega
Formatos e entrega
Cada lote é entregue com a versão da taxonomia contra a qual foi rotulado e um changelog em relação ao lote anterior, para que os conjuntos de dados sigam comparáveis entre versões.
| Tipo de dado | Entrega típica | Também disponível |
|---|---|---|
| Texto e NLP | JSONL | CSV, CoNLL-U, brat standoff, Parquet |
| Instrução e preferência para LLM | JSONL (messages / chosen–rejected) | CSV, layout de dataset Hugging Face |
| Fala | JSON com marcações de tempo | SRT, VTT, CTM, TextGrid, transcrição em texto simples |
| Imagem e vídeo | COCO JSON | YOLO, Pascal VOC, CVAT XML, JSONL por quadro |
| Documentos e OCR | JSON com geometria da página | hOCR, ALTO, extração de campos em CSV |
| Resultados de avaliação | Pontuações em JSONL mais um relatório de QA | CSV, notebook de pontuação, log de arbitragem |
FAQ
Sobre os serviços
Perguntas de escopo e de processo que aparecem antes de um piloto ser definido.
Sim, e a maioria dos programas faz isso. Uma sequência típica é anotação de NLP para estabelecer um corpus rotulado, dados de treinamento de LLM construídos a partir dele e, então, avaliação conduzida por um grupo separado de anotadores. Reunir tudo em um mesmo contrato faz com que a taxonomia, o guia de estilo e as métricas de QA se mantenham consistentes, em vez de serem redefinidos a cada fornecedor.
O japonês é aquilo para o qual fomos construídos, e o trabalho bilíngue japonês–inglês está dentro disso. Para trabalhos de volume em outros idiomas, preferimos dizer com franqueza que não somos o fornecedor certo a aceitar o projeto e subcontratá-lo.
O preço é por unidade de trabalho — por item, por hora de áudio, por imagem ou por avaliação — e depende da complexidade da tarefa, de quanto tempo de revisão cada item exige e do nível de expertise necessário. Orçamos depois de definir o escopo de um piloto sobre os seus dados reais, porque um orçamento baseado na descrição de uma tarefa é um palpite, e em geral um palpite errado.
Nós redigimos, você revisa, e as duas coisas acontecem antes da produção. O piloto existe para quebrar a primeira versão em casos-limite reais; toda divergência resolvida nele é escrita de volta no documento. A diretriz é então versionada, e cada lote entregue registra a versão contra a qual foi rotulado.
Comece por aqui
Conte o que o modelo precisa aprender.
Envie a tarefa, uma amostra de dados e as restrições com que você trabalha. Voltamos com um plano de piloto com escopo definido, as questões de taxonomia que precisariam ser respondidas e uma visão honesta do que há de difícil nisso.
NDA antes de você compartilhar qualquer dado. A definição do escopo do piloto é gratuita.