Vision & multimodale KI

Japanische Bild-, Video- und Dokumentannotation

Bounding Boxes, Polygone, Segmentierung, Keypoints, Video-Tracking, OCR und Dokumentlayout – auf Daten, in denen der Text im Bild japanisch ist und die Dokumente japanischen Geschäftskonventionen folgen.

Die meiste Vision-Annotation ist sprachneutral. Sobald Text im Bild steht oder ein japanisches Formular auf der Seite liegt, hört sie sehr schnell auf, es zu sein.

Worin japanische Vision-Daten sich unterscheiden

Einen Kasten um ein Auto zu ziehen ist in jedem Land dieselbe Arbeit. Den Text auf einem japanischen Kassenbeleg zu lesen nicht. Japanische Dokumente laufen ebenso oft vertikal wie horizontal, mischen vier Schriften in einer einzigen Zeile, verwenden vollbreite lateinische Zeichen und Ziffern, tragen Furigana über den Wörtern, die sie erläutern, und setzen ein Firmensiegel dorthin, wo ein westliches Formular eine Unterschrift erwartet.

Dokument-KI-Projekte scheitern an diesen Details und nicht am Modell. Eine Layout-Annotation, die eine vertikale Spalte als fünf getrennte Zeilen behandelt, oder eine OCR-Transkription, die vollbreite Ziffern stillschweigend in halbbreite umwandelt, erzeugt Trainingsdaten, die dem Modell etwas anderes beibringen als beabsichtigt.

Dasselbe gilt für Text auf Bildschirmen und im öffentlichen Raum: Ladenschilder, Produktverpackungen, Speisekarten und Bahnhofsanzeigen sind dicht an japanischer Typografie, die generische Annotationsrichtlinien schlicht nicht behandeln.

Im Überblick

Aufgabenarten
Detektion, Segmentierung, Keypoints, Klassifikation, Video-Tracking, OCR-Transkription, Dokumentlayout und Feldextraktion.
Dokumentarbeit
Rechnungen, Belege, Bestellungen, Verträge, Antragsformulare, handschriftliche Einträge und Material in Vertikalschrift.
Umgang mit Japanisch
Vertikaltext, Furigana, gemischte Schriften, vollbreite Zeichen und japanische Formularkonventionen.
Typische Ausgabe
COCO JSON; YOLO, Pascal VOC, CVAT XML, hOCR und ALTO werden ebenfalls unterstützt.
Prüfung
Geometrie und Label werden getrennt geprüft, weil sie auf verschiedene Weise fehlschlagen.

Aufgabenarten

Was wir annotieren

Geometrie, Kategorie und Text sind getrennte Schichten und werden getrennt geprüft.

Detektion und Segmentierung

Bounding Boxes, rotierte Boxen, Polygone und pixelgenaue Masken gegen eine vor der Produktion vereinbarte Klassentaxonomie.

  • 2D- und rotierte Bounding Boxes
  • Polygon- und Instanzsegmentierung
  • Semantische Segmentierung
  • Flags für Verdeckung und Anschnitt

Keypoints und Attribute

Setzen von Landmarken und Attribute je Objekt für Pose, Produktzustand, Zustandsbewertung und ähnliche feingranulare Arbeit.

  • Skelett- und Landmarken-Keypoints
  • Attributsätze je Objekt
  • Feingranulare Klassifikation
  • Sichtbarkeits-Flags je Punkt

Videoannotation

Objektverfolgung über Frames hinweg mit stabilen Identitäten, dazu zeitliche Segmentierung von Aktionen und Ereignissen.

  • Tracking-IDs für mehrere Objekte
  • Aktions- und Ereignisbereiche
  • Prüfung interpolierter Frame-Intervalle
  • Wiedererkennung nach Verdeckung

OCR und Dokumentlayout

Erkennung von Textregionen, Lesereihenfolge, Transkription und strukturelle Rollen auf japanischen Geschäftsdokumenten.

  • Erkennung von Textzeilen und -regionen
  • Lesereihenfolge bei vertikalem und gemischtem Layout
  • Transkription mit Normalisierungsregel
  • Tabellen-, Kopf- und Siegelregionen

Feld- und Relationsextraktion

Ein Dokument in strukturierte Werte überführen – welcher Text die Summe ist, welches Datum das Ausstellungsdatum, welche Positionen zusammengehören.

  • Tagging von Schlüssel-Wert-Feldern
  • Gruppierung von Positionen in Tabellen
  • Seitenübergreifende Relationen
  • Flags für Konfidenz und Mehrdeutigkeit

Japanisch-spezifisch

Was generische Vision-Richtlinien übersehen

Vier wiederkehrende Schwachstellen bei japanischen Bild- und Dokumentdaten.

Vertikaltext und Lesereihenfolge

Japanisch läuft von oben nach unten und von rechts nach links ebenso wie von links nach rechts, und eine einzelne Seite mischt oft beides. Werkzeuge, die horizontale Zeilen unterstellen, erzeugen eine Lesereihenfolge, die selbstsicher falsch ist.

Unser Vorgehen Die Lesereihenfolge wird ausdrücklich annotiert statt aus der Geometrie abgeleitet, mit Regeln für Seiten mit gemischter Ausrichtung, Ruby-Text und mehrspaltiges Layout.

Furigana und Ruby-Text

Kleine Kana über oder neben einem Kanji-Wort sind eine Aussprachehilfe, kein zusätzlicher Inhalt. Inline transkribiert verderben sie den Text; blind verworfen geht Information verloren, die Sie vielleicht brauchen.

Unser Vorgehen Ruby wird als verknüpfte Annotation an seinem Basistext erfasst, sodass es später behalten, verworfen oder als Lesungslabel genutzt werden kann, ohne neu zu annotieren.

Vollbreite und halbbreite Zeichen

A123 und A123 sehen fast identisch aus und sind verschiedene Zeichen. Unkontrollierte Normalisierung ist hier einer der häufigsten stillen Defekte in japanischen OCR-Datensätzen.

Unser Vorgehen Die Transkriptionskonvention benennt genau, welche Zeichen normalisiert und welche unverändert erhalten werden, und eine automatische Prüfung setzt das vor der Lieferung durch.

Japanische Formularkonventionen

Japanische Rechnungen, Belege und Anträge haben ihr eigenes strukturelles Vokabular – 御中, 但し書き, Firmensiegel, Datumsangaben nach Ära sowie Brutto- und Nettosummen direkt nebeneinander.

Unser Vorgehen Das Feldschema entsteht an echten Beispielen Ihrer Dokumenttypen, wobei Ära-Datumsangaben, Siegelregionen und die Steuerbehandlung als eigenständige Felder definiert werden statt als Freitext.

Prozess

Wie ein Vision-Projekt abläuft

Taxonomie und Geometrieregeln werden an einer echten Stichprobe geklärt, bevor irgendjemand in großem Umfang annotiert.

  1. 01

    Stichprobe und Taxonomie festlegen

    Wir annotieren ein kleines repräsentatives Set, um die mehrdeutigen Fälle zu finden – was als ein Objekt zählt, was am Bildrand passiert, wann eine Klasse wirklich unklar ist.

  2. 02

    Die Geometrieregeln schreiben

    Enge der Boxen, Umgang mit Verdeckung, Mindestgröße von Objekten, Anschnitt, Objektgruppen und die Behandlung unlesbaren Textes werden schriftlich festgelegt.

  3. 03

    Kalibrieren

    Mehrere Annotatoren labeln dieselben Bilder unabhängig. Die Geometrieübereinstimmung wird gemessen, und wo sie niedrig ist, war die Regel mehrdeutig.

  4. 04

    Annotieren und prüfen

    Geometrie und Labels werden in getrennten Durchläufen geprüft, denn eine enge Box auf der falschen Klasse und eine lose Box auf der richtigen sind verschiedene Defekte.

  5. 05

    Liefern und berichten

    Die Annotationen kommen in Ihrem Format, mit der Taxonomieversion, den Zählungen je Klasse und dem QA-Bericht zur Charge.

Lieferung

Formate hinein und heraus

Wir exportieren in das native Format Ihrer Trainingspipeline, statt Sie einen Konverter schreiben zu lassen.

Übliche Ausgabeformate für Bild-, Video- und Dokumentarbeit.
AufgabeStandardausgabeEbenfalls möglich
Detektion und SegmentierungCOCO JSONYOLO, Pascal VOC, CVAT XML, Masken als PNG
Keypoints und AttributeCOCO keypoints JSONCSV, eigenes JSON-Schema
Video-TrackingMOT-FormatCOCO je Frame, CVAT XML
OCR und LayoutJSON mit SeitengeometriehOCR, ALTO, PAGE XML
FeldextraktionJSONL, ein Dokument je ZeileCSV, Ihr Dokument-KI-Schema

Qualität

Kontrollen speziell für diese Arbeit

Vision-Defekte verstecken sich gut. Diese Prüfungen holen sie hervor, bevor das Training es tut.

  • Die Geometrieübereinstimmung wird an einer neu annotierten Stichprobe gemessen und getrennt von der Labelübereinstimmung berichtet.
  • Automatische Prüfungen auf entartete Boxen, überlappende Duplikate und Objekte außerhalb des Bildbereichs.
  • Lesereihenfolge und Ruby-Verknüpfung werden auf jeder Dokumentseite validiert, nicht stichprobenweise.
  • Die Normalisierung vollbreiter und halbbreiter Zeichen wird automatisch gegen die schriftliche Konvention durchgesetzt.
  • Tracking-Identitäten werden über den ganzen Clip geprüft, damit ein Identitätstausch nach einer Verdeckung auffällt.
  • Die Zählungen je Klasse werden in jeder Charge geprüft, damit eine still verschwindende Klasse früh bemerkt wird.

FAQ

Zu Bild, Video und Dokumenten

Häufige Fragen zu japanischer Vision- und Dokument-KI-Arbeit.

Ja – handschriftliche Formulareinträge, Adressen, Namen und Freitextkommentare. Handschrift ist langsamer und wirklich mehrdeutiger als Druck; wir markieren deshalb unsichere Zeichen, statt zu raten, und klären vorab, ob ein unleserliches Feld nach bestem Wissen transkribiert oder als unlesbar markiert wird. Diese Entscheidung ist für Ihr Modell wichtiger als die rohe Genauigkeitszahl.

Ja. Wir arbeiten in kundenseitig bereitgestellten Plattformen – darunter CVAT, Label Studio, SageMaker Ground Truth, Labelbox und interne Werkzeuge – oder in unserer eigenen abgesicherten Umgebung, wenn Sie keine Zugänge einrichten möchten. Welche davon wir nutzen, ändert weder die Richtlinie noch den Prüfprozess.

Ja, und bei Detektionsarbeit mit hohem Volumen ist das oft der sinnvolle Weg. Das Risiko ist, dass Korrekturdurchläufe die blinden Flecken des Modells erben; wir messen den Korrekturdurchlauf deshalb gegen eine von Grund auf annotierte Stichprobe und sagen Ihnen, was er tatsächlich findet. Bei OCR auf japanischen Dokumenten sind wir zurückhaltender, weil Modellfehler bei vollbreiten Zeichen und Vertikaltext am Bildschirm leicht übersehen werden.

Unter NDA und Auftragsverarbeitungsvertrag, in einer isolierten Umgebung, mit Zugriff nur für die im Projekt eingesetzten Personen. Wir können personenbezogene Daten auch zur Schwärzung annotieren oder ausschließlich mit Material arbeiten, das Sie vor dem Versand geschwärzt haben. Aufbewahrungs- und Löschregeln werden vertraglich vereinbart und nicht einer Richtlinie überlassen.

Japanische Dokumente verwenden häufig Ära-Jahre – 令和6年 statt 2024 – und mischen oft beides auf derselben Seite. Wir behandeln das Ära-Datum als eigenes Feld mit erhaltener Originalzeichenkette, dazu einen normalisierten gregorianischen Wert, wenn Sie einen möchten. So geht bei der Umrechnung keine Information verloren und kein Umrechnungsfehler wird fest in die Daten eingeschrieben.

Bild & Video

Schicken Sie eine Seite, ein Frame oder einen ganzen Ordner.

Eine repräsentative Stichprobe Ihrer echten Dokumente oder Aufnahmen genügt uns, um eine Taxonomie zu entwerfen, ein Pilotset zu annotieren und Ihnen zu sagen, wo die Mehrdeutigkeit liegen wird.

NDA, bevor Sie Daten übermitteln. Die Planung des Pilotprojekts ist kostenlos.