Visual & multimodal

Anotasi gambar, video, dan dokumen bahasa Jepang

Bounding box, poligon, segmentasi, keypoint, pelacakan video, OCR, dan tata letak dokumen — pada data yang teks di dalam gambarnya berbahasa Jepang dan dokumennya mengikuti konvensi bisnis Jepang.

Sebagian besar anotasi visual bersifat netral bahasa. Begitu ada teks di dalam bingkai, atau sebuah formulir Jepang di halaman itu, sifat netral bahasa itu cepat sekali hilang.

Di mana data visual berbahasa Jepang berbeda

Menggambar kotak di sekeliling sebuah mobil adalah pekerjaan yang sama di negara mana pun. Membaca teks pada struk berbahasa Jepang tidak demikian. Dokumen Jepang ditulis vertikal sama seringnya dengan horizontal, mencampur empat aksara dalam satu baris, memakai huruf Latin dan angka full-width, membawa furigana di atas kata yang dijelaskannya, dan menempatkan stempel perusahaan di tempat yang pada formulir Barat diisi tanda tangan.

Proyek document AI gagal karena detail semacam itu, bukan karena modelnya. Anotasi tata letak yang memperlakukan satu kolom vertikal sebagai lima baris terpisah, atau transkripsi OCR yang diam-diam mengubah angka full-width menjadi half-width, menghasilkan data pelatihan yang mengajari model sesuatu yang berbeda dari yang Anda maksudkan.

Hal yang sama berlaku untuk teks di layar dan di ruang publik: papan nama toko, kemasan produk, menu, dan papan stasiun padat dengan tipografi Jepang yang sama sekali tidak dibahas oleh pedoman anotasi generik.

Sekilas

Jenis tugas
Deteksi, segmentasi, keypoint, klasifikasi, pelacakan video, transkripsi OCR, tata letak dokumen, dan ekstraksi field.
Pekerjaan dokumen
Faktur, struk, pesanan pembelian, kontrak, formulir permohonan, isian tulisan tangan, dan materi berteks vertikal.
Penanganan bahasa Jepang
Teks vertikal, furigana, aksara campuran, karakter full-width, dan konvensi formulir Jepang.
Keluaran umum
COCO JSON; YOLO, Pascal VOC, CVAT XML, hOCR, dan ALTO juga didukung.
Tinjauan
Geometri dan label ditinjau terpisah, karena keduanya gagal dengan cara yang berbeda.

Jenis tugas

Yang kami anotasi

Geometri, kategori, dan teks adalah lapisan yang terpisah, dan ditinjau secara terpisah pula.

Deteksi dan segmentasi

Bounding box, kotak berputar, poligon, dan mask tingkat piksel mengikuti taksonomi kelas yang disepakati sebelum produksi.

  • Bounding box 2D dan berputar
  • Segmentasi poligon dan instans
  • Segmentasi semantik
  • Penanda oklusi dan pemotongan

Keypoint dan atribut

Penempatan titik penanda dan atribut per objek untuk pose, kondisi produk, penilaian tingkat kerusakan, dan pekerjaan berbutir halus sejenisnya.

  • Keypoint kerangka dan titik penanda
  • Set atribut per objek
  • Klasifikasi berbutir halus
  • Penanda keterlihatan tiap titik

Anotasi video

Pelacakan objek antarframe dengan identitas yang stabil, ditambah segmentasi temporal untuk aksi dan peristiwa.

  • ID pelacakan banyak objek
  • Rentang aksi dan peristiwa
  • Tinjauan interpolasi antarframe
  • Identifikasi ulang setelah oklusi

OCR dan tata letak dokumen

Deteksi wilayah teks, urutan baca, transkripsi, dan peran struktural pada dokumen bisnis berbahasa Jepang.

  • Deteksi baris dan wilayah teks
  • Urutan baca untuk tata letak vertikal dan campuran
  • Transkripsi dengan aturan normalisasi
  • Wilayah tabel, kepala halaman, dan stempel

Ekstraksi field dan relasi

Mengubah dokumen menjadi nilai terstruktur — teks mana yang merupakan total, tanggal mana yang merupakan tanggal terbit, baris item mana yang saling berkaitan.

  • Penandaan field kunci–nilai
  • Pengelompokan baris item dalam tabel
  • Relasi antarhalaman
  • Penanda keyakinan dan ambiguitas

Khas bahasa Jepang

Apa yang terlewat oleh pedoman visual generik

Empat titik kegagalan yang berulang pada data gambar dan dokumen berbahasa Jepang.

Teks vertikal dan urutan baca

Bahasa Jepang mengalir dari atas ke bawah dan dari kanan ke kiri, selain juga dari kiri ke kanan, dan satu halaman kerap mencampur keduanya. Perangkat yang mengasumsikan baris horizontal menghasilkan urutan baca yang salah dengan penuh keyakinan.

Cara kami menanganinya Urutan baca dianotasi secara eksplisit, bukan disimpulkan dari geometri, lengkap dengan aturan untuk halaman berorientasi campuran, teks ruby, dan tata letak berkolom banyak.

Furigana dan teks ruby

Kana kecil yang dicetak di atas atau di samping kata berkanji adalah penanda pelafalan, bukan konten tambahan. Jika ditranskripsikan menyatu, ia merusak teksnya; jika dibuang begitu saja, informasi yang mungkin Anda butuhkan ikut hilang.

Cara kami menanganinya Ruby direkam sebagai anotasi yang tertaut pada teks dasarnya, sehingga di tahap berikutnya ia dapat dipertahankan, dibuang, atau dipakai sebagai label pelafalan tanpa perlu anotasi ulang.

Karakter full-width dan half-width

A123 dan A123 terlihat nyaris sama padahal karakternya berbeda. Normalisasi yang tidak dikendalikan di sini adalah salah satu cacat senyap yang paling sering muncul pada dataset OCR bahasa Jepang.

Cara kami menanganinya Konvensi transkripsi menyatakan persis karakter mana yang dinormalisasi dan mana yang dipertahankan, dan pemeriksaan otomatis menegakkannya sebelum pengiriman.

Konvensi formulir Jepang

Faktur, struk, dan formulir permohonan Jepang punya kosakata strukturalnya sendiri — 御中, 但し書き, stempel perusahaan, tanggal berbasis era kaisar, serta total termasuk dan belum termasuk pajak yang berdampingan.

Cara kami menanganinya Skema field dibangun berdasarkan contoh nyata dari jenis dokumen Anda, dengan tanggal era, wilayah stempel, dan perlakuan pajak ditetapkan sebagai field tersendiri, bukan sebagai teks bebas.

Proses

Bagaimana sebuah proyek visual dijalankan

Taksonomi dan aturan geometri dituntaskan pada sampel nyata sebelum siapa pun menganotasi dalam volume besar.

  1. 01

    Mengambil sampel dan menetapkan taksonomi

    Kami menganotasi satu set kecil yang representatif untuk menemukan kasus-kasus ambigu — apa yang dihitung sebagai satu objek, apa yang terjadi di tepi bingkai, kapan sebuah kelas memang benar-benar tidak jelas.

  2. 02

    Menulis aturan geometri

    Kerapatan kotak, penanganan oklusi, ukuran objek minimum, pemotongan, objek berkelompok, dan perlakuan terhadap teks yang tak terbaca semuanya dikunci secara tertulis.

  3. 03

    Kalibrasi

    Beberapa anotator melabeli gambar yang sama secara independen. Kesepakatan geometri diukur, dan jika rendah berarti aturannya ambigu.

  4. 04

    Anotasi dan tinjauan

    Geometri dan label ditinjau sebagai dua tahap terpisah, karena kotak yang rapat pada kelas yang salah dan kotak yang longgar pada kelas yang benar adalah dua cacat yang berbeda.

  5. 05

    Pengiriman dan pelaporan

    Anotasi dikirim dalam format Anda beserta versi taksonomi, jumlah per kelas, dan laporan QA untuk batch tersebut.

Pengiriman

Format masuk dan keluar

Kami mengekspor ke format asli pipeline pelatihan Anda, alih-alih membuat Anda menulis pengonversi sendiri.

Format keluaran yang umum untuk pekerjaan gambar, video, dan dokumen.
TugasKeluaran defaultTersedia juga
Deteksi dan segmentasiCOCO JSONYOLO, Pascal VOC, CVAT XML, mask sebagai PNG
Keypoint dan atributCOCO keypoints JSONCSV, skema JSON khusus
Pelacakan videoFormat MOTCOCO per frame, CVAT XML
OCR dan tata letakJSON dengan geometri halamanhOCR, ALTO, PAGE XML
Ekstraksi fieldJSONL, satu dokumen per barisCSV, skema document AI Anda

Kualitas

Kontrol yang khusus untuk pekerjaan ini

Cacat pada data visual pandai bersembunyi. Pemeriksaan berikut yang memunculkannya sebelum pelatihan melakukannya.

  • Kesepakatan geometri diukur pada sampel yang dianotasi ulang, dilaporkan terpisah dari kesepakatan label.
  • Pemeriksaan otomatis untuk kotak degenerat, duplikat yang bertumpuk, dan objek di luar batas gambar.
  • Urutan baca dan pertautan ruby divalidasi pada setiap halaman dokumen, bukan hanya pada sampel.
  • Normalisasi full-width dan half-width ditegakkan secara otomatis mengikuti konvensi tertulis.
  • Identitas pelacakan diperiksa di sepanjang klip, sehingga tertukarnya identitas setelah oklusi dapat tertangkap.
  • Jumlah per kelas ditinjau tiap batch, sehingga kelas yang diam-diam menghilang dari data segera diketahui.

FAQ

Seputar gambar, video, dan dokumen

Pertanyaan yang umum muncul pada pekerjaan visual dan document AI berbahasa Jepang.

Bisa — isian formulir tulisan tangan, alamat, nama, dan komentar teks bebas. Tulisan tangan lebih lambat dikerjakan dan tingkat ambiguitasnya memang lebih tinggi daripada cetakan, jadi kami menandai karakter yang tidak pasti alih-alih menebaknya, dan kami menyepakati lebih dahulu apakah field yang tidak terbaca ditranskripsikan sebisanya atau ditandai sebagai tak terbaca. Keputusan itu lebih menentukan bagi model Anda daripada angka akurasi mentahnya.

Ya. Kami bekerja di dalam platform yang disediakan klien — antara lain CVAT, Label Studio, SageMaker Ground Truth, Labelbox, dan perangkat internal — atau di lingkungan aman milik kami sendiri jika Anda lebih memilih tidak menyiapkan akun. Platform mana pun yang dipakai tidak mengubah pedoman maupun proses tinjauannya.

Bisa, dan pada pekerjaan deteksi bervolume tinggi hal itu sering kali pendekatan yang masuk akal. Risikonya, tahap koreksi mewarisi titik buta model, jadi kami mengukur tahap koreksi itu terhadap sampel yang dikerjakan dari nol dan memberi tahu Anda apa yang sebenarnya tertangkap. Untuk OCR pada dokumen berbahasa Jepang kami lebih berhati-hati, karena kesalahan model pada karakter full-width dan teks vertikal mudah terlewat di layar.

Di bawah NDA dan perjanjian pemrosesan data, di lingkungan terisolasi, dengan akses terbatas hanya pada orang-orang di proyek tersebut. Kami juga dapat menganotasi informasi pribadi untuk keperluan redaksi, atau hanya bekerja pada materi yang sudah Anda redaksi sebelum dikirim. Ketentuan retensi dan penghapusan disepakati dalam kontrak, bukan diserahkan pada kebijakan sepihak.

Dokumen Jepang lazim memakai tahun era — 令和6年 alih-alih 2024 — dan sering mencampur keduanya pada halaman yang sama. Kami memperlakukan tanggal era sebagai field tersendiri dengan string aslinya dipertahankan, ditambah nilai Gregorian yang dinormalisasi bila Anda menginginkannya, sehingga tidak ada informasi yang hilang dalam konversi dan tidak ada kesalahan konversi yang ikut tertanam di dalam data.

Gambar & video

Kirimkan satu halaman, satu frame, atau satu folder.

Sampel yang representatif dari dokumen atau rekaman Anda yang sebenarnya sudah cukup bagi kami untuk menyusun draf taksonomi, menganotasi satu set pilot, dan memberi tahu Anda di mana ambiguitasnya akan muncul.

NDA sebelum Anda membagikan data apa pun. Penentuan cakupan pilot tanpa biaya.