Vision et multimodal

Annotation d’images, de vidéos et de documents japonais

Boîtes englobantes, polygones, segmentation, points clés, suivi vidéo, OCR et mise en page de documents — sur des données où le texte de l’image est en japonais et où les documents suivent les conventions commerciales japonaises.

La plupart des annotations de vision sont indépendantes de la langue. Dès qu’il y a du texte dans le cadre, ou un formulaire japonais sur la page, elles cessent très vite de l’être.

Là où les données de vision japonaises diffèrent

Tracer une boîte autour d’une voiture est le même travail dans tous les pays. Lire le texte d’un reçu japonais, non. Les documents japonais s’écrivent aussi souvent à la verticale qu’à l’horizontale, mêlent quatre écritures dans une même ligne, emploient des lettres latines et des chiffres pleine chasse, portent des furigana au-dessus des mots qu’ils glosent, et placent un sceau d’entreprise là où un formulaire occidental attend une signature.

Les projets d’IA documentaire échouent sur ces détails plutôt que sur le modèle. Une annotation de mise en page qui traite une colonne verticale comme cinq lignes distinctes, ou une transcription OCR qui convertit silencieusement des chiffres pleine chasse en demi-chasse, produit des données d’entraînement qui enseignent au modèle autre chose que ce que vous vouliez.

Il en va de même pour le texte à l’écran et en environnement réel : enseignes de magasins, emballages de produits, menus et panneaux de gare regorgent d’une typographie japonaise que les consignes d’annotation génériques n’abordent tout simplement pas.

En bref

Types de tâches
Détection, segmentation, points clés, classification, suivi vidéo, transcription OCR, mise en page de documents et extraction de champs.
Travaux documentaires
Factures, reçus, bons de commande, contrats, formulaires de demande, saisies manuscrites et documents en écriture verticale.
Traitement du japonais
Écriture verticale, furigana, écritures mêlées, caractères pleine chasse et conventions des formulaires japonais.
Sortie habituelle
COCO JSON ; YOLO, Pascal VOC, CVAT XML, hOCR et ALTO également pris en charge.
Relecture
Géométrie et étiquette relues séparément, car elles échouent de manières différentes.

Types de tâches

Ce que nous annotons

Géométrie, catégorie et texte sont des couches distinctes, et sont relues séparément.

Détection et segmentation

Boîtes englobantes, boîtes orientées, polygones et masques au pixel près, selon une taxonomie de classes convenue avant la production.

  • Boîtes englobantes 2D et orientées
  • Segmentation par polygones et par instances
  • Segmentation sémantique
  • Indicateurs d’occlusion et de troncature

Points clés et attributs

Placement de repères et attributs par objet pour la pose, l’état d’un produit, la notation d’état et les travaux fins du même ordre.

  • Squelettes et points de repère
  • Jeux d’attributs par objet
  • Classification fine
  • Indicateurs de visibilité par point

Annotation vidéo

Suivi d’objets d’une image à l’autre avec des identités stables, et segmentation temporelle des actions et des événements.

  • Identifiants de suivi multi-objets
  • Plages d’actions et d’événements
  • Relecture de l’interpolation entre images
  • Réidentification après occlusion

OCR et mise en page de documents

Détection des zones de texte, ordre de lecture, transcription et rôles structurels sur des documents commerciaux japonais.

  • Détection des lignes et zones de texte
  • Ordre de lecture pour les mises en page verticales et mixtes
  • Transcription avec règle de normalisation
  • Zones de tableau, d’en-tête et de sceau

Extraction de champs et de relations

Transformer un document en valeurs structurées — quel texte est le total, quelle date est la date d’émission, quelles lignes vont ensemble.

  • Marquage de champs clé–valeur
  • Regroupement des lignes de tableau
  • Relations entre pages
  • Indicateurs de confiance et d’ambiguïté

Spécificités japonaises

Ce que les consignes de vision génériques oublient

Quatre points de défaillance récurrents sur les images et documents japonais.

Écriture verticale et ordre de lecture

Le japonais se lit de haut en bas et de droite à gauche aussi bien que de gauche à droite, et une même page mêle souvent les deux. Les outils qui supposent des lignes horizontales produisent un ordre de lecture faux avec assurance.

Notre approche L’ordre de lecture est annoté explicitement plutôt que déduit de la géométrie, avec des règles pour les pages à orientation mixte, le texte ruby et les mises en page multicolonnes.

Furigana et texte ruby

Les petits kana imprimés au-dessus ou à côté d’un mot en kanji sont une glose de prononciation, pas un contenu supplémentaire. Transcrits en ligne, ils corrompent le texte ; supprimés à l’aveugle, ils font perdre une information dont vous pourriez avoir besoin.

Notre approche Le ruby est capté comme une annotation liée à son texte de base, ce qui permet de le conserver, de l’écarter ou de l’utiliser comme étiquette de lecture en aval sans réannoter.

Caractères pleine chasse et demi-chasse

A123 et A123 se ressemblent presque et sont des caractères différents. Une normalisation non maîtrisée sur ce point est l’un des défauts silencieux les plus fréquents des jeux de données OCR japonais.

Notre approche La convention de transcription indique exactement quels caractères sont normalisés et lesquels sont conservés, et un contrôle automatique l’applique avant livraison.

Conventions des formulaires japonais

Les factures, reçus et formulaires japonais ont leur vocabulaire structurel propre — 御中, 但し書き, sceaux d’entreprise, dates en années d’ère, totaux TTC et HT côte à côte.

Notre approche Le schéma de champs est construit à partir d’exemples réels de vos types de documents, les dates d’ère, les zones de sceau et le traitement de la taxe étant définis comme des champs à part entière plutôt que comme du texte libre.

Processus

Comment se déroule un projet de vision

La taxonomie et les règles de géométrie sont arrêtées sur un échantillon réel avant toute annotation en volume.

  1. 01

    Échantillonner et définir la taxonomie

    Nous annotons un petit ensemble représentatif pour repérer les cas ambigus — ce qui compte pour un objet, ce qui se passe au bord du cadre, quand une classe est réellement incertaine.

  2. 02

    Rédiger les règles de géométrie

    Serrage des boîtes, traitement des occlusions, taille minimale d’objet, troncature, objets groupés et traitement du texte illisible sont tous fixés par écrit.

  3. 03

    Calibrer

    Plusieurs annotateurs étiquettent les mêmes images indépendamment. L’accord géométrique est mesuré, et là où il est faible, la règle était ambiguë.

  4. 04

    Annoter et relire

    Géométrie et étiquettes sont relues en passes séparées, car une boîte serrée sur la mauvaise classe et une boîte lâche sur la bonne sont deux défauts distincts.

  5. 05

    Livrer et restituer

    Les annotations sont livrées dans votre format avec la version de taxonomie, les effectifs par classe et le rapport QA du lot.

Livraison

Formats en entrée et en sortie

Nous exportons dans le format natif de votre chaîne d’entraînement plutôt que de vous obliger à écrire un convertisseur.

Formats de sortie courants pour les travaux d’image, de vidéo et de document.
TâcheSortie par défautÉgalement disponible
Détection et segmentationCOCO JSONYOLO, Pascal VOC, CVAT XML, masques en PNG
Points clés et attributsCOCO keypoints JSONCSV, schéma JSON sur mesure
Suivi vidéoFormat MOTCOCO par image, CVAT XML
OCR et mise en pageJSON avec géométrie de pagehOCR, ALTO, PAGE XML
Extraction de champsJSONL, un document par ligneCSV, votre schéma d’IA documentaire

Qualité

Contrôles propres à ce travail

Les défauts de vision se dissimulent bien. Voici les contrôles qui les font apparaître avant que l’entraînement ne s’en charge.

  • Accord géométrique mesuré sur un échantillon réannoté, restitué séparément de l’accord sur les étiquettes.
  • Contrôles automatiques des boîtes dégénérées, des doublons superposés et des objets hors des limites de l’image.
  • Ordre de lecture et rattachement du ruby validés sur chaque page de document, sans échantillonnage.
  • Normalisation pleine chasse / demi-chasse appliquée automatiquement selon la convention écrite.
  • Identités de suivi vérifiées sur l’intégralité du clip, afin de détecter une inversion d’identité après une occlusion.
  • Effectifs par classe examinés à chaque lot, pour repérer tôt une classe qui disparaît discrètement des données.

FAQ

À propos des images, vidéos et documents

Questions fréquentes sur les travaux de vision et d’IA documentaire en japonais.

Oui — saisies manuscrites de formulaires, adresses, noms et commentaires libres. L’écriture manuscrite est plus lente et présente un taux d’ambiguïté réellement plus élevé que l’imprimé ; nous marquons donc les caractères incertains plutôt que de les deviner, et nous convenons à l’avance si un champ illisible est transcrit au mieux ou signalé comme illisible. Cette décision compte davantage pour votre modèle que le chiffre brut d’exactitude.

Oui. Nous travaillons dans les plateformes fournies par le client — CVAT, Label Studio, SageMaker Ground Truth, Labelbox et outils internes, entre autres — ou dans notre propre environnement sécurisé lorsque vous préférez ne pas créer de comptes. L’outil utilisé ne change ni les consignes ni le processus de relecture.

Oui, et sur des travaux de détection à fort volume c’est souvent l’approche sensée. Le risque est que les passes de correction héritent des angles morts du modèle ; nous mesurons donc la passe de correction contre un échantillon annoté de zéro et vous disons ce qu’elle rattrape réellement. Pour l’OCR sur documents japonais, nous sommes plus prudents, car les erreurs de modèle sur les caractères pleine chasse et l’écriture verticale sont faciles à laisser passer à l’écran.

Sous NDA et accord de traitement des données, dans un environnement isolé, avec un accès limité aux personnes affectées au projet. Nous pouvons aussi annoter les informations personnelles en vue d’un caviardage, ou travailler uniquement sur des documents que vous avez caviardés avant envoi. Les durées de conservation et les modalités de suppression sont convenues au contrat plutôt que laissées à une politique interne.

Les documents japonais emploient couramment les années d’ère — 令和6年 plutôt que 2024 — et mêlent souvent les deux sur une même page. Nous traitons la date d’ère comme un champ à part entière avec conservation de la chaîne d’origine, plus une valeur grégorienne normalisée lorsque vous en voulez une, de sorte qu’aucune information ne se perd dans la conversion et qu’aucune erreur de conversion ne s’inscrit dans les données.

Image & vidéo

Envoyez une page, une image ou un dossier.

Un échantillon représentatif de vos documents ou de vos images réels nous suffit pour rédiger une taxonomie, annoter un jeu pilote et vous dire où se situera l’ambiguïté.

NDA avant tout partage de données. Le cadrage du pilote est gratuit.