Visão e multimodal

Anotação de imagem, vídeo e documentos em japonês

Caixas delimitadoras, polígonos, segmentação, keypoints, rastreamento em vídeo, OCR e layout de documentos — em dados nos quais o texto da imagem é japonês e os documentos seguem convenções de negócios japonesas.

A maior parte da anotação de visão é neutra em relação ao idioma. No momento em que há texto no quadro, ou um formulário japonês na página, ela deixa de ser neutra bem depressa.

Onde os dados de visão em japonês são diferentes

Desenhar uma caixa em torno de um carro é o mesmo trabalho em qualquer país. Ler o texto de um recibo japonês não é. Os documentos japoneses correm na vertical com a mesma frequência que na horizontal, misturam quatro sistemas de escrita em uma única linha, usam caracteres latinos e dígitos de largura total, trazem furigana acima das palavras que glosam e colocam um carimbo da empresa onde um formulário ocidental espera uma assinatura.

Projetos de document AI fracassam nesses detalhes, e não no modelo. Uma anotação de layout que trate uma coluna vertical como cinco linhas separadas, ou uma transcrição de OCR que converta em silêncio dígitos de largura total para meia largura, produz dados de treinamento que ensinam ao modelo algo diferente do que você pretendia.

O mesmo vale para texto em tela e em ambientes reais: placas de loja, embalagens de produtos, cardápios e painéis de estação são densos em tipografia japonesa que as diretrizes genéricas de anotação simplesmente não abordam.

Resumo

Tipos de tarefa
Detecção, segmentação, keypoints, classificação, rastreamento em vídeo, transcrição de OCR, layout de documentos e extração de campos.
Trabalho com documentos
Notas fiscais, recibos, pedidos de compra, contratos, formulários de solicitação, preenchimentos manuscritos e material em texto vertical.
Tratamento do japonês
Texto vertical, furigana, escritas misturadas, caracteres de largura total e convenções de formulários japoneses.
Saída típica
COCO JSON; YOLO, Pascal VOC, CVAT XML, hOCR e ALTO também são suportados.
Revisão
Geometria e rótulo revisados separadamente, porque falham de maneiras diferentes.

Tipos de tarefa

O que anotamos

Geometria, categoria e texto são camadas distintas, e são revisadas separadamente.

Detecção e segmentação

Caixas delimitadoras, caixas rotacionadas, polígonos e máscaras em nível de pixel, segundo uma taxonomia de classes acordada antes da produção.

  • Caixas 2D e rotacionadas
  • Segmentação por polígono e de instâncias
  • Segmentação semântica
  • Sinalizadores de oclusão e de truncamento

Keypoints e atributos

Posicionamento de pontos de referência e atributos por objeto para pose, estado do produto, classificação de condição e trabalhos de granularidade fina semelhantes.

  • Keypoints de esqueleto e de referência
  • Conjuntos de atributos por objeto
  • Classificação de granularidade fina
  • Sinalizadores de visibilidade por ponto

Anotação de vídeo

Rastreamento de objetos ao longo dos quadros com identidades estáveis, mais segmentação temporal de ações e eventos.

  • IDs de rastreamento multiobjeto
  • Intervalos de ações e eventos
  • Revisão da interpolação entre quadros
  • Reidentificação após oclusão

OCR e layout de documentos

Detecção de regiões de texto, ordem de leitura, transcrição e papéis estruturais em documentos de negócios japoneses.

  • Detecção de linhas e regiões de texto
  • Ordem de leitura para layout vertical e misto
  • Transcrição com regra de normalização
  • Regiões de tabela, cabeçalho e carimbo

Extração de campos e relações

Transformar um documento em valores estruturados — qual texto é o total, qual data é a de emissão, quais itens de linha pertencem ao mesmo grupo.

  • Marcação de campos chave–valor
  • Agrupamento de itens de linha em tabelas
  • Relações entre páginas
  • Sinalizadores de confiança e de ambiguidade

Especificidades do japonês

O que as diretrizes genéricas de visão deixam passar

Quatro pontos de falha recorrentes em dados de imagem e de documentos em japonês.

Texto vertical e ordem de leitura

O japonês corre de cima para baixo e da direita para a esquerda, além de da esquerda para a direita, e uma mesma página muitas vezes mistura as duas direções. Ferramentas que pressupõem linhas horizontais produzem uma ordem de leitura confiantemente errada.

Como tratamos A ordem de leitura é anotada explicitamente, em vez de inferida da geometria, com regras para páginas de orientação mista, texto ruby e layout em várias colunas.

Furigana e texto ruby

Os pequenos kana impressos acima ou ao lado de uma palavra em kanji são uma glosa de pronúncia, não conteúdo adicional. Transcritos na linha, corrompem o texto; descartados às cegas, perdem informação de que você pode precisar.

Como tratamos O ruby é capturado como uma anotação vinculada ao seu texto base, de modo que possa ser mantido, removido ou usado como rótulo de leitura mais adiante, sem precisar reanotar.

Caracteres de largura total e de meia largura

A123 e A123 parecem quase idênticos e são caracteres diferentes. A normalização descontrolada aqui é um dos defeitos silenciosos mais comuns em conjuntos de OCR em japonês.

Como tratamos A convenção de transcrição diz exatamente quais caracteres são normalizados e quais são preservados, e uma verificação automática garante isso antes da entrega.

Convenções dos formulários japoneses

Notas fiscais, recibos e formulários japoneses têm seu próprio vocabulário estrutural — 御中, 但し書き, carimbos de empresa, datas por era e totais com e sem imposto lado a lado.

Como tratamos O esquema de campos é construído a partir de exemplos reais dos seus tipos de documento, com datas por era, regiões de carimbo e tratamento tributário definidos como campos de primeira classe, e não como texto livre.

Processo

Como um projeto de visão é conduzido

A taxonomia e as regras de geometria são resolvidas em uma amostra real antes que alguém anote em volume.

  1. 01

    Amostrar e definir a taxonomia

    Anotamos um pequeno conjunto representativo para encontrar os casos ambíguos — o que conta como um objeto, o que acontece na borda do quadro, quando uma classe é genuinamente incerta.

  2. 02

    Escrever as regras de geometria

    Justeza das caixas, tratamento de oclusão, tamanho mínimo de objeto, truncamento, objetos em grupo e o tratamento de texto ilegível são todos fixados por escrito.

  3. 03

    Calibrar

    Vários anotadores rotulam as mesmas imagens de forma independente. A concordância de geometria é medida e, onde ela é baixa, a regra estava ambígua.

  4. 04

    Anotar e revisar

    Geometria e rótulos são revisados em passagens separadas, porque uma caixa justa na classe errada e uma caixa frouxa na classe certa são defeitos diferentes.

  5. 05

    Entregar e reportar

    As anotações são entregues no seu formato, com a versão da taxonomia, as contagens por classe e o relatório de QA do lote.

Entrega

Formatos de entrada e de saída

Exportamos no formato nativo do seu pipeline de treinamento, em vez de obrigar você a escrever um conversor.

Formatos de saída comuns para trabalhos de imagem, vídeo e documentos.
TarefaSaída padrãoTambém disponível
Detecção e segmentaçãoCOCO JSONYOLO, Pascal VOC, CVAT XML, máscaras em PNG
Keypoints e atributosCOCO keypoints JSONCSV, esquema JSON personalizado
Rastreamento em vídeoformato MOTCOCO por quadro, CVAT XML
OCR e layoutJSON com geometria da páginahOCR, ALTO, PAGE XML
Extração de camposJSONL, um documento por linhaCSV, o seu esquema de document AI

Qualidade

Controles específicos deste trabalho

Defeitos de visão se escondem bem. Estas verificações são as que os trazem à tona antes do treinamento.

  • Concordância de geometria medida em uma amostra reanotada e reportada separadamente da concordância de rótulos.
  • Verificações automáticas de caixas degeneradas, duplicatas sobrepostas e objetos fora dos limites da imagem.
  • Ordem de leitura e vínculo do ruby validados em todas as páginas de documento, sem amostragem.
  • Normalização de largura total e meia largura aplicada automaticamente conforme a convenção escrita.
  • Identidades de rastreamento conferidas ao longo de todo o clipe, para que uma troca de identidade após uma oclusão seja detectada.
  • Contagens por classe revisadas a cada lote, para que uma classe que some silenciosamente dos dados seja percebida cedo.

FAQ

Sobre imagem, vídeo e documentos

Perguntas comuns sobre trabalhos de visão e de document AI em japonês.

Sim — campos de formulário manuscritos, endereços, nomes e comentários em texto livre. A escrita à mão é mais lenta e tem uma taxa de ambiguidade genuinamente maior do que a impressa, então marcamos os caracteres incertos em vez de adivinhar, e combinamos de antemão se um campo ilegível é transcrito da melhor forma possível ou sinalizado como ilegível. Essa decisão importa mais para o seu modelo do que o número bruto de acurácia.

Sim. Trabalhamos dentro de plataformas fornecidas pelo cliente — CVAT, Label Studio, SageMaker Ground Truth, Labelbox e ferramentas internas, entre outras — ou no nosso próprio ambiente seguro, quando você preferir não abrir contas. Qual delas usamos não muda a diretriz nem o processo de revisão.

Sim, e em trabalhos de detecção de alto volume isso costuma ser a abordagem sensata. O risco é que as passagens de correção herdem os pontos cegos do modelo, então medimos a passagem de correção contra uma amostra feita do zero e dizemos o que ela está de fato pegando. Para OCR em documentos japoneses somos mais cautelosos, porque erros do modelo em caracteres de largura total e em texto vertical passam facilmente despercebidos na tela.

Sob NDA e acordo de processamento de dados, em ambiente isolado, com acesso limitado às pessoas alocadas no projeto. Também podemos anotar informações pessoais para supressão, ou trabalhar apenas com material que você já tenha tratado antes de enviar. Os prazos de retenção e o método de exclusão são acordados em contrato, e não deixados a cargo de uma política.

Documentos japoneses costumam usar anos por era — 令和6年 em vez de 2024 — e com frequência misturam os dois na mesma página. Tratamos a data por era como um campo próprio, com a cadeia original preservada, mais um valor gregoriano normalizado quando você quiser um, de modo que nenhuma informação se perca na conversão e nenhum erro de conversão fique embutido nos dados.

Imagem e vídeo

Envie uma página, um quadro ou uma pasta.

Uma amostra representativa dos seus documentos ou das suas imagens reais basta para rascunharmos uma taxonomia, anotarmos um conjunto piloto e dizermos onde estará a ambiguidade.

NDA antes de você compartilhar qualquer dado. A definição do escopo do piloto é gratuita.