Serviços

Dados de treinamento de IA em japonês, em todas as modalidades

Cinco serviços que cobrem o que um sistema de IA precisa em cada etapa — dos dados de instrução que ensinam o modelo à avaliação humana que diz se aquilo funcionou.

Os cinco funcionam sobre a mesma base: anotadores no Japão, diretrizes versionadas em vez de memorizadas e qualidade que é medida antes de ser afirmada.

Um time, todo o ciclo de vida dos dados

A maior parte dos problemas de anotação não é de rotulagem. É de definição: duas pessoas razoáveis leem a mesma diretriz e rotulam a mesma frase em japonês de formas diferentes, e ninguém percebe até o modelo ser treinado com as duas. Dividir o trabalho em cinco serviços é um jeito de tornar essas definições explícitas — cada serviço tem suas próprias questões de taxonomia, seus próprios modos de falha e suas próprias verificações de qualidade.

Os serviços não são pacotes entre os quais você precisa escolher. Um único projeto costuma usar três deles: anotação de NLP para construir um corpus rotulado, dados de treinamento de LLM para transformá-lo em pares de instrução e de preferência, e avaliação para medir o que o modelo resultante de fato faz. O que se mantém constante é o julgamento sobre a língua japonesa por trás de tudo isso.

Resumo

Modalidades
Dados em japonês de texto, fala, imagem, vídeo, documentos e multimodais.
Etapas do modelo
Filtragem de corpus, ajuste fino supervisionado, dados de preferência e RLHF, avaliação e benchmarking.
Formatos de entrega
JSONL, CSV, CoNLL-U, SRT, CTM, COCO — ou um esquema definido por você.
Ferramentas
Trabalhamos dentro da sua plataforma de anotação ou no nosso próprio ambiente seguro.
Ponto de partida
Um piloto com escopo definido. Taxonomia e qualidade são comprovadas antes de o volume crescer.

O que fazemos

Cinco serviços, mais a camada de especialistas

Cada um tem sua própria página, com as decisões de taxonomia, as armadilhas específicas do japonês e os entregáveis detalhados.

Dados para LLM

Conjuntos de instrução, de preferência e de RLHF escritos em japonês, com as decisões de registro tomadas de forma explícita.

  • Dados de instrução e SFT
  • Dados de preferência e de ranqueamento
  • Diálogo multiturno
  • Dados de segurança, recusa e red team
Ver o serviço

Avaliação de LLM

Avaliação humana da saída de modelos em japonês — rubricas, preferência pareada, factualidade e red teaming.

  • Preferência pareada
  • Pontuação por rubrica
  • Factualidade e grounding
  • Segurança e red teaming
Ver o serviço

Fala e áudio

Transcrição para ASR, diarização e rotulagem de intenção em japonês, com a convenção de normalização posta por escrito.

  • Transcrição
  • Tempo e alinhamento
  • Rotulagem de falantes
  • Rotulagem de intenção e slots
Ver o serviço

Imagem e vídeo

Caixas delimitadoras, segmentação, OCR e layout de documentos em imagens, vídeos e papelada em japonês.

  • Detecção e segmentação
  • Keypoints e atributos
  • Anotação de vídeo
  • OCR e layout de documentos
Ver o serviço

Texto e NLP

Entidades, relações, intenção e sentimento em texto japonês, com as fronteiras do tokenizador decididas em vez de presumidas.

  • Reconhecimento de entidades nomeadas
  • Extração de relações e eventos
  • Classificação
  • Sentimento e emoção
Ver o serviço

Especialistas

Anotação e avaliação com especialistas de domínio japoneses, para IA que atua em setores regulados.

  • Advogados
  • Contadores tributários
  • Contadores públicos certificados
  • Especialistas trabalhistas e previdenciários
Ver o serviço

Escolha

De qual serviço eu preciso?

Comece pelo que você quer mudar no modelo. O serviço decorre disso, e não do tipo de arquivo que você por acaso tem.

Como ligar um objetivo a um serviço. A maioria dos programas acaba combinando dois ou três.
Se o seu objetivo é…O serviço éPrimeiro entregável típico
Ensinar o modelo a responder em japonês natural e no registro corretoDados para LLMUm conjunto piloto de pares instrução–resposta com um guia de estilo congelado
Descobrir onde o modelo erra antes de colocá-lo no arAvaliação de LLMUm conjunto de avaliação pontuado, com rubrica e concordância entre avaliadores
Fazer o modelo ouvir fala em japonês com precisãoFala e áudioÁudio transcrito com uma convenção de normalização escrita
Ler documentos, formulários ou texto em tela em japonêsImagem e vídeoAnotação de OCR e de layout em uma amostra representativa de documentos
Extrair fatos estruturados de texto em japonêsTexto e NLPUm esquema de entidades e relações testado em casos-limite reais
Ter especialistas julgando respostas em uma área reguladaAnotação por especialistasUm conjunto de avaliação revisado por especialistas, com notas de arbitragem por escrito

Ciclo de vida

Onde cada serviço se encaixa

O mesmo conjunto de dados raramente serve a duas etapas. Dados construídos para ensinar um modelo são um teste ruim dele, porque o modelo já os viu.

  1. 01

    Preparação do corpus

    Regras de filtragem e de deduplicação, sinalizadores de qualidade e de segurança sobre texto, fala ou documentos brutos em japonês. Define o que vale a pena anotar.

  2. 02

    Ajuste fino supervisionado

    Pares instrução–resposta, diálogo multiturno e demonstrações de tarefa escritos no registro que o produto de fato usa.

  3. 03

    Preferência e alinhamento

    Comparações ranqueadas ou pareadas, comportamento de segurança e de recusa, e os critérios escritos que tornam uma resposta melhor do que outra.

  4. 04

    Avaliação

    Conjuntos reservados e pontuação por rubrica feitos por pessoas que não participaram da construção dos dados de treinamento, para que a medição seja independente.

  5. 05

    Monitoramento em produção

    Amostrar a saída do modelo em produção, pontuá-la com a mesma rubrica e devolver as falhas recorrentes ao ciclo de dados seguinte.

Entrega

Formatos e entrega

Cada lote é entregue com a versão da taxonomia contra a qual foi rotulado e um changelog em relação ao lote anterior, para que os conjuntos de dados sigam comparáveis entre versões.

Formatos de entrega comuns. Esquemas personalizados são definidos no kickoff e versionados junto com os dados.
Tipo de dadoEntrega típicaTambém disponível
Texto e NLPJSONLCSV, CoNLL-U, brat standoff, Parquet
Instrução e preferência para LLMJSONL (messages / chosen–rejected)CSV, layout de dataset Hugging Face
FalaJSON com marcações de tempoSRT, VTT, CTM, TextGrid, transcrição em texto simples
Imagem e vídeoCOCO JSONYOLO, Pascal VOC, CVAT XML, JSONL por quadro
Documentos e OCRJSON com geometria da páginahOCR, ALTO, extração de campos em CSV
Resultados de avaliaçãoPontuações em JSONL mais um relatório de QACSV, notebook de pontuação, log de arbitragem

FAQ

Sobre os serviços

Perguntas de escopo e de processo que aparecem antes de um piloto ser definido.

Sim, e a maioria dos programas faz isso. Uma sequência típica é anotação de NLP para estabelecer um corpus rotulado, dados de treinamento de LLM construídos a partir dele e, então, avaliação conduzida por um grupo separado de anotadores. Reunir tudo em um mesmo contrato faz com que a taxonomia, o guia de estilo e as métricas de QA se mantenham consistentes, em vez de serem redefinidos a cada fornecedor.

O japonês é aquilo para o qual fomos construídos, e o trabalho bilíngue japonês–inglês está dentro disso. Para trabalhos de volume em outros idiomas, preferimos dizer com franqueza que não somos o fornecedor certo a aceitar o projeto e subcontratá-lo.

O preço é por unidade de trabalho — por item, por hora de áudio, por imagem ou por avaliação — e depende da complexidade da tarefa, de quanto tempo de revisão cada item exige e do nível de expertise necessário. Orçamos depois de definir o escopo de um piloto sobre os seus dados reais, porque um orçamento baseado na descrição de uma tarefa é um palpite, e em geral um palpite errado.

Nós redigimos, você revisa, e as duas coisas acontecem antes da produção. O piloto existe para quebrar a primeira versão em casos-limite reais; toda divergência resolvida nele é escrita de volta no documento. A diretriz é então versionada, e cada lote entregue registra a versão contra a qual foi rotulado.

Comece por aqui

Conte o que o modelo precisa aprender.

Envie a tarefa, uma amostra de dados e as restrições com que você trabalha. Voltamos com um plano de piloto com escopo definido, as questões de taxonomia que precisariam ser respondidas e uma visão honesta do que há de difícil nisso.

NDA antes de você compartilhar qualquer dado. A definição do escopo do piloto é gratuita.