Thị giác & đa phương thức

Gán nhãn hình ảnh, video và tài liệu tiếng Nhật

Khung bao, đa giác, phân vùng, điểm khóa, theo vết trong video, OCR và bố cục tài liệu — trên dữ liệu mà văn bản trong ảnh là tiếng Nhật và tài liệu tuân theo quy ước giấy tờ kinh doanh Nhật Bản.

Phần lớn công việc gán nhãn thị giác không phụ thuộc ngôn ngữ. Nhưng chỉ cần có chữ trong khung hình, hoặc một biểu mẫu Nhật trên trang giấy, là sự độc lập đó biến mất rất nhanh.

Dữ liệu thị giác tiếng Nhật khác ở chỗ nào

Vẽ một khung quanh chiếc xe hơi là công việc như nhau ở mọi quốc gia. Đọc chữ trên một hóa đơn Nhật thì không. Tài liệu Nhật viết theo chiều dọc cũng thường xuyên như viết ngang, trộn bốn hệ chữ viết trong cùng một dòng, dùng ký tự Latin và chữ số dạng full-width, mang furigana phía trên những từ mà nó chú âm, và đặt con dấu công ty ở chỗ mà biểu mẫu phương Tây trông đợi một chữ ký.

Các dự án Document AI thất bại vì những chi tiết này chứ không phải vì mô hình. Một bản gán nhãn bố cục coi một cột dọc là năm dòng riêng biệt, hay một bản chuyển văn bản OCR âm thầm đổi chữ số full-width thành half-width, sẽ tạo ra dữ liệu huấn luyện dạy cho mô hình một thứ khác với điều quý khách định dạy.

Điều tương tự cũng đúng với chữ trên màn hình và chữ ngoài đời thực: biển hiệu cửa hàng, bao bì sản phẩm, thực đơn và bảng thông tin nhà ga đều dày đặc kiểu chữ tiếng Nhật mà các tài liệu hướng dẫn gán nhãn phổ thông đơn giản là không đề cập tới.

Tổng quan nhanh

Loại tác vụ
Phát hiện đối tượng, phân vùng, điểm khóa, phân loại, theo vết trong video, chuyển văn bản OCR, bố cục tài liệu và trích xuất trường dữ liệu.
Công việc về tài liệu
Hóa đơn, biên lai, đơn đặt hàng, hợp đồng, biểu mẫu đăng ký, phần ghi tay và tài liệu viết dọc.
Xử lý đặc thù tiếng Nhật
Văn bản viết dọc, furigana, hệ chữ viết trộn lẫn, ký tự full-width và quy ước biểu mẫu Nhật Bản.
Đầu ra thường dùng
COCO JSON; cũng hỗ trợ YOLO, Pascal VOC, CVAT XML, hOCR và ALTO.
Thẩm định
Hình học và nhãn được thẩm định riêng, vì chúng hỏng theo những cách khác nhau.

Loại tác vụ

Chúng tôi gán nhãn gì

Hình học, phân loại và văn bản là những lớp riêng biệt, và được thẩm định riêng.

Phát hiện đối tượng và phân vùng

Khung bao, khung bao xoay, đa giác và mặt nạ ở cấp điểm ảnh theo một bảng phân loại lớp đã thống nhất trước khi triển khai chính thức.

  • Khung bao 2D và khung bao xoay
  • Phân vùng theo đa giác và theo thực thể
  • Phân vùng ngữ nghĩa
  • Cờ đánh dấu che khuất và cắt cụt

Điểm khóa và thuộc tính

Đặt điểm mốc và gán thuộc tính cho từng đối tượng phục vụ nhận dạng tư thế, trạng thái sản phẩm, phân hạng tình trạng và các công việc chi tiết tương tự.

  • Điểm khóa khung xương và điểm mốc
  • Bộ thuộc tính theo từng đối tượng
  • Phân loại chi tiết
  • Cờ mức độ nhìn thấy cho từng điểm

Gán nhãn video

Theo vết đối tượng qua các khung hình với danh tính ổn định, cùng việc phân đoạn theo thời gian cho hành động và sự kiện.

  • Mã theo vết nhiều đối tượng
  • Khoảng thời gian của hành động và sự kiện
  • Thẩm định phần nội suy giữa các khung hình
  • Nhận dạng lại sau khi bị che khuất

OCR và bố cục tài liệu

Phát hiện vùng văn bản, thứ tự đọc, chuyển thành văn bản và xác định vai trò cấu trúc trên tài liệu kinh doanh tiếng Nhật.

  • Phát hiện dòng và vùng văn bản
  • Thứ tự đọc cho bố cục dọc và bố cục hỗn hợp
  • Chuyển thành văn bản theo một quy tắc chuẩn hóa
  • Vùng bảng biểu, tiêu đề và con dấu

Trích xuất trường dữ liệu và quan hệ

Biến một tài liệu thành các giá trị có cấu trúc — đoạn chữ nào là tổng tiền, ngày nào là ngày phát hành, những dòng hàng nào thuộc về nhau.

  • Gán nhãn trường theo cặp khóa – giá trị
  • Nhóm các dòng hàng trong bảng
  • Quan hệ xuyên trang
  • Cờ độ tin cậy và mức mơ hồ

Đặc thù tiếng Nhật

Những gì tài liệu hướng dẫn thị giác phổ thông bỏ sót

Bốn điểm hay hỏng lặp đi lặp lại trên dữ liệu hình ảnh và tài liệu tiếng Nhật.

Văn bản viết dọc và thứ tự đọc

Tiếng Nhật viết từ trên xuống dưới, từ phải sang trái, đồng thời cũng viết từ trái sang phải, và một trang thường trộn cả hai. Những công cụ mặc định rằng dòng chữ nằm ngang sẽ tạo ra một thứ tự đọc sai một cách rất tự tin.

Cách chúng tôi xử lý Thứ tự đọc được gán nhãn tường minh chứ không suy ra từ hình học, kèm quy tắc cho trang trộn nhiều hướng viết, chữ ruby và bố cục nhiều cột.

Furigana và chữ ruby

Những chữ kana nhỏ in phía trên hoặc bên cạnh một từ kanji là phần chú âm, không phải nội dung bổ sung. Nếu ghi thẳng vào dòng, chúng làm hỏng văn bản; nếu bỏ đi một cách máy móc, chúng làm mất thông tin mà quý khách có thể cần.

Cách chúng tôi xử lý Chữ ruby được ghi lại như một chú giải liên kết với văn bản gốc, để về sau có thể giữ, bỏ hoặc dùng làm nhãn cách đọc mà không phải gán nhãn lại.

Ký tự full-width và half-width

A123 và A123 trông gần như giống hệt nhau nhưng là những ký tự khác nhau. Việc chuẩn hóa không kiểm soát ở đây là một trong những lỗi âm thầm phổ biến nhất trong các bộ dữ liệu OCR tiếng Nhật.

Cách chúng tôi xử lý Quy ước chuyển thành văn bản nêu rõ ký tự nào được chuẩn hóa và ký tự nào được giữ nguyên, và một khâu kiểm tra tự động thực thi điều đó trước khi bàn giao.

Quy ước biểu mẫu Nhật Bản

Hóa đơn, biên lai và đơn từ Nhật Bản có bộ từ vựng cấu trúc riêng — 御中, 但し書き, con dấu công ty, ngày tháng theo niên hiệu, tổng tiền đã bao gồm thuế và chưa bao gồm thuế đặt cạnh nhau.

Cách chúng tôi xử lý Schema trường dữ liệu được xây dựng dựa trên ví dụ thật thuộc các loại tài liệu của quý khách, trong đó ngày theo niên hiệu, vùng con dấu và cách xử lý thuế được định nghĩa thành các trường chính thức chứ không phải văn bản tự do.

Quy trình

Một dự án thị giác diễn ra như thế nào

Bảng phân loại nhãn và các quy tắc về hình học được chốt trên một mẫu thật trước khi có ai gán nhãn ở quy mô lớn.

  1. 01

    Lấy mẫu và xác định bảng phân loại nhãn

    Chúng tôi gán nhãn một tập nhỏ có tính đại diện để tìm ra các trường hợp mơ hồ — thế nào là một đối tượng, xử lý ra sao ở mép khung hình, khi nào một lớp thực sự không rõ ràng.

  2. 02

    Viết quy tắc về hình học

    Độ khít của khung bao, cách xử lý che khuất, kích thước đối tượng tối thiểu, phần bị cắt cụt, đối tượng theo nhóm và cách xử lý văn bản không đọc được đều được chốt bằng văn bản.

  3. 03

    Hiệu chỉnh

    Nhiều chuyên viên gán nhãn cùng những bức ảnh giống nhau một cách độc lập. Mức đồng thuận về hình học được đo, và chỗ nào thấp thì quy tắc ở đó còn mơ hồ.

  4. 04

    Gán nhãn và thẩm định

    Hình học và nhãn được thẩm định thành hai lượt riêng, vì một khung bao khít trên lớp sai và một khung bao lỏng trên lớp đúng là hai loại lỗi khác nhau.

  5. 05

    Bàn giao và báo cáo

    Phần gán nhãn được bàn giao theo định dạng của quý khách kèm phiên bản bảng phân loại nhãn, số lượng theo từng lớp và báo cáo QA của lô.

Bàn giao

Định dạng đầu vào và đầu ra

Chúng tôi xuất dữ liệu theo đúng định dạng gốc của quy trình huấn luyện bên quý khách thay vì bắt quý khách phải viết bộ chuyển đổi.

Các định dạng đầu ra thông dụng cho công việc về hình ảnh, video và tài liệu.
Tác vụĐầu ra mặc địnhCũng có sẵn
Phát hiện đối tượng và phân vùngCOCO JSONYOLO, Pascal VOC, CVAT XML, mặt nạ dạng PNG
Điểm khóa và thuộc tínhCOCO keypoints JSONCSV, schema JSON tùy chỉnh
Theo vết trong videoĐịnh dạng MOTCOCO theo từng khung hình, CVAT XML
OCR và bố cụcJSON kèm tọa độ tranghOCR, ALTO, PAGE XML
Trích xuất trường dữ liệuJSONL, mỗi dòng một tài liệuCSV, schema document-AI của quý khách

Chất lượng

Những khâu kiểm soát riêng cho công việc này

Lỗi trong dữ liệu thị giác rất khéo ẩn mình. Đây là những khâu kiểm tra làm chúng lộ ra trước khi quá trình huấn luyện làm việc đó.

  • Mức đồng thuận về hình học được đo trên một mẫu gán nhãn lại, báo cáo tách riêng khỏi mức đồng thuận về nhãn.
  • Kiểm tra tự động các khung bao suy biến, các bản trùng lặp chồng lên nhau và các đối tượng nằm ngoài phạm vi ảnh.
  • Thứ tự đọc và liên kết chữ ruby được kiểm chứng trên mọi trang tài liệu, không lấy mẫu.
  • Việc chuẩn hóa full-width và half-width được thực thi tự động theo đúng quy ước đã viết.
  • Danh tính theo vết được kiểm tra trên toàn bộ đoạn phim, để bắt được trường hợp hoán đổi danh tính sau khi bị che khuất.
  • Số lượng theo từng lớp được rà soát ở mỗi lô, để sớm phát hiện một lớp âm thầm biến mất khỏi dữ liệu.

FAQ

Về hình ảnh, video và tài liệu

Những câu hỏi thường gặp về công việc thị giác và document AI tiếng Nhật.

Có — phần ghi tay trên biểu mẫu, địa chỉ, họ tên và bình luận tự do. Chữ viết tay chậm hơn và có tỷ lệ mơ hồ thực sự cao hơn chữ in, nên chúng tôi đánh dấu những ký tự không chắc chắn thay vì đoán, và thống nhất trước xem một trường không đọc được sẽ được ghi theo phương án tốt nhất có thể hay bị đánh dấu là không đọc được. Quyết định đó quan trọng với mô hình của quý khách hơn cả con số chính xác thô.

Có. Chúng tôi làm việc trong các nền tảng do khách hàng cung cấp — trong đó có CVAT, Label Studio, SageMaker Ground Truth, Labelbox và các công cụ nội bộ — hoặc trong môi trường bảo mật của riêng chúng tôi khi quý khách không muốn cấp thêm tài khoản. Dùng công cụ nào cũng không làm thay đổi tài liệu hướng dẫn hay quy trình thẩm định.

Có, và với công việc phát hiện đối tượng khối lượng lớn thì đó thường là cách hợp lý. Rủi ro là lượt sửa sẽ thừa hưởng luôn các điểm mù của mô hình, nên chúng tôi đo lượt sửa đó so với một mẫu gán nhãn từ đầu và cho quý khách biết nó thực sự bắt được những gì. Với OCR trên tài liệu tiếng Nhật, chúng tôi thận trọng hơn, vì lỗi của mô hình ở ký tự full-width và văn bản viết dọc rất dễ bị bỏ sót khi nhìn trên màn hình.

Theo NDA và thỏa thuận xử lý dữ liệu, trong một môi trường tách biệt, với quyền truy cập giới hạn ở những người tham gia dự án. Chúng tôi cũng có thể gán nhãn thông tin cá nhân để che, hoặc chỉ làm việc trên tài liệu mà quý khách đã che trước khi gửi. Các điều khoản về thời hạn lưu trữ và xóa dữ liệu được thống nhất trong hợp đồng chứ không để mặc cho chính sách chung.

Tài liệu Nhật thường dùng năm theo niên hiệu — 令和6年 thay vì 2024 — và thường trộn cả hai trên cùng một trang. Chúng tôi xử lý ngày theo niên hiệu như một trường riêng với chuỗi gốc được giữ nguyên, cộng thêm một giá trị dương lịch đã chuẩn hóa nếu quý khách muốn, để không mất thông tin trong quá trình quy đổi và không có lỗi quy đổi nào bị đóng cứng vào dữ liệu.

Hình ảnh & video

Hãy gửi một trang, một khung hình, hoặc cả một thư mục.

Một mẫu có tính đại diện từ tài liệu hoặc đoạn phim thật của quý khách là đủ để chúng tôi soạn bảng phân loại nhãn, gán nhãn một bộ thử nghiệm và chỉ ra chỗ nào sẽ có sự mơ hồ.

Ký NDA trước khi quý khách chia sẻ bất kỳ dữ liệu nào. Xác định phạm vi thử nghiệm là miễn phí.