視覺與多模態

日文影像、影片與文件標註

定界框、多邊形、分割、關鍵點、影片追蹤、OCR 與文件版面——處理的是畫面中文字為日文、文件遵循日本商務慣例的資料。

多數視覺標註與語言無關。但只要畫面裡出現文字,或頁面上是一張日本表單,它就會很快地不再與語言無關。

日文視覺資料的不同之處

在車子外圍畫一個框,在哪個國家都是同一件事;讀懂一張日本收據上的文字則不然。日文文件直書與橫書一樣常見,同一行內混用四套文字系統,使用全形拉丁字母與數字,在被注音的詞上方標注假名,並在西式表單預期簽名的位置蓋上公司印章。

文件 AI 專案栽的通常是這些細節,而不是模型本身。把一個直書欄位當成五行分開處理的版面標註,或是把全形數字默默轉成半形的 OCR 轉錄,產出的訓練資料教給模型的,就不是您原本想教的東西。

畫面文字與街景文字也是如此:店家招牌、商品包裝、菜單與車站看板上,滿是通用標註規範根本沒有處理過的日文排版樣式。

重點速覽

任務類型
偵測、分割、關鍵點、分類、影片追蹤、OCR 轉錄、文件版面與欄位抽取。
文件類型
發票、收據、訂購單、合約、申請表、手寫填寫內容與直書材料。
日文處理
直書文字、注音假名、混合文字系統、全形字元與日本表單慣例。
典型輸出
COCO JSON;亦支援 YOLO、Pascal VOC、CVAT XML、hOCR 與 ALTO。
審查
幾何與標籤分開審查,因為兩者的失效方式不同。

任務類型

我們標註什麼

幾何、類別與文字是分開的層級,也分開審查。

偵測與分割

依量產前議定的類別分類,標註定界框、旋轉框、多邊形與像素層級遮罩。

  • 2D 與旋轉定界框
  • 多邊形與實例分割
  • 語意分割
  • 遮擋與截斷旗標

關鍵點與屬性

為姿態、商品狀態、狀況分級等細粒度工作,標註特徵點位置與各物件的屬性。

  • 骨架與特徵點
  • 各物件的屬性集
  • 細粒度分類
  • 各點的可見性旗標

影片標註

跨影格追蹤物件並維持穩定的身分,並對動作與事件做時間軸切分。

  • 多物件追蹤 ID
  • 動作與事件區間
  • 影格區間內插結果的審查
  • 遮擋後的重新辨識

OCR 與文件版面

在日本商務文件上進行文字區域偵測、閱讀順序、文字轉錄與結構角色標註。

  • 文字行與區域偵測
  • 直書與混合版面的閱讀順序
  • 依正規化規則進行轉錄
  • 表格、頁首與印章區域

欄位與關係抽取

把文件轉成結構化的值——哪段文字是總金額、哪個日期是開立日、哪些明細列屬於同一組。

  • 鍵–值欄位標記
  • 表格中的明細列分組
  • 跨頁關係
  • 信心度與歧義旗標

日文特有事項

通用視覺規範會漏掉什麼

日文影像與文件資料上,四個反覆出現的失效點。

直書與閱讀順序

日文既可由上到下、由右到左,也可由左到右書寫,而同一頁常常兩者混用。假設文字為橫排的工具,會產出一個「錯得很有自信」的閱讀順序。

我們的處理方式 閱讀順序是明確標註出來的,而不是從幾何位置推測,並訂有混合方向頁面、注音文字與多欄版面的規則。

注音假名與注音文字

印在漢字詞上方或旁邊的小假名是讀音註記,不是額外的內容。若把它們照原位轉錄進去會汙染文字;若不加思索地丟掉,又會失去您可能需要的資訊。

我們的處理方式 注音文字會以連結標註的形式掛在其對應的本文上,讓下游可以保留、捨棄或當作讀音標籤使用,不必重新標註。

全形與半形字元

A123 與 A123 看起來幾乎一樣,卻是不同的字元。這裡若不控管正規化,是日文 OCR 資料集中最常見的隱性缺陷之一。

我們的處理方式 轉錄慣例明確載明哪些字元會被正規化、哪些必須原樣保留,並在交付前以自動檢查強制執行。

日本表單慣例

日本的發票、收據與申請書有自己的一套結構用語——御中、但し書き、公司印章、以年號紀年的日期,以及並列的含稅與未稅總額。

我們的處理方式 欄位 schema 依貴團隊文件類型的真實範例建立,年號日期、印章區域與稅額處理都被定義為一級欄位,而不是自由文字。

流程

一個視覺專案怎麼進行

在任何人開始大量標註之前,先在真實樣本上把標籤分類與幾何規則定下來。

  1. 01

    取樣並定義標籤分類

    我們先標註一小批具代表性的資料,找出模稜兩可的情況——什麼算是一個物件、物件在畫面邊緣時怎麼處理、類別確實不明時該怎麼辦。

  2. 02

    撰寫幾何規則

    框的貼合程度、遮擋處理、最小物件尺寸、截斷、群體物件,以及無法辨讀文字的處理方式,全都以書面固定下來。

  3. 03

    校準

    數位標註人員各自獨立標註相同影像。我們會量測幾何一致率,一致率偏低之處,就代表規則有模糊地帶。

  4. 04

    標註與審查

    幾何與標籤分成兩輪審查,因為「框得很準但類別錯了」與「類別對但框得鬆散」是兩種不同的缺陷。

  5. 05

    交付與呈報

    標註成果以貴團隊的格式交付,並附上標籤分類版本、各類別數量與該批次的品質報告。

交付

輸入與輸出格式

我們直接匯出成貴團隊訓練管線的原生格式,不需要您另外寫轉換程式。

影像、影片與文件工作常見的輸出格式。
任務預設輸出亦可提供
偵測與分割COCO JSONYOLO、Pascal VOC、CVAT XML、PNG 遮罩
關鍵點與屬性COCO keypoints JSONCSV、自訂 JSON schema
影片追蹤MOT 格式逐影格 COCO、CVAT XML
OCR 與版面含頁面座標的 JSONhOCR、ALTO、PAGE XML
欄位抽取JSONL,每行一份文件CSV、貴團隊的文件 AI schema

品質

針對這類工作的控管措施

視覺缺陷很擅長藏起來。以下這些檢查,能在訓練之前先把它們挖出來。

  • 在重新標註的樣本上量測幾何一致率,並與標籤一致率分開呈報。
  • 自動檢查退化的定界框、重疊的重複標註,以及超出影像範圍的物件。
  • 閱讀順序與注音文字連結逐頁驗證,不採抽樣。
  • 依書面慣例自動強制執行全形與半形的正規化。
  • 追蹤身分就整段影片通盤檢查,讓遮擋後身分對調的情況能被抓出來。
  • 每一批都檢視各類別數量,讓某個類別悄悄從資料中消失時能及早發現。

常見問題

關於影像、影片與文件

日文視覺與文件 AI 工作的常見問題。

可以——手寫的表單填寫內容、地址、姓名與自由填答意見都能處理。手寫比印刷慢,歧義率也確實更高,因此我們會標記不確定的字元而不是用猜的;並且事先議定:無法辨讀的欄位是盡力轉錄,還是標記為無法辨讀。這個決定對您的模型而言,比原始正確率數字更重要。

可以。我們能在客戶提供的平台內作業——包括 CVAT、Label Studio、SageMaker Ground Truth、Labelbox 與內部自建工具——若您不方便開設帳號,我們也可在自己的安全環境中進行。用哪個平台不會改變標註規範或審查流程。

可以,而且在大量的偵測工作上,這往往是合理的做法。風險在於修正這一關會繼承模型的盲點,因此我們會拿它與從零標註的樣本比對,告訴您它實際抓出了什麼。至於日文文件的 OCR,我們比較保守,因為全形字元與直書文字上的模型錯誤在螢幕上很容易被看漏。

在保密協議與資料處理協議之下,於隔離環境中作業,存取權限僅限專案成員。我們也能標註個人資料以供遮蔽,或只處理您在寄送前已遮蔽過的材料。保存與刪除條款寫進合約,而不是交由內部政策決定。

日本文件常使用年號紀年——例如寫成令和6年而非 2024——而且同一頁常常兩種並存。我們把年號日期視為獨立欄位,保留原始字串,並在您需要時附上正規化後的西元值,讓轉換過程不會遺失資訊,也不會把轉換錯誤固化進資料裡。

影像與影片

寄一頁、一個影格,或一整個資料夾給我們。

一份具代表性的真實文件或影像樣本,就足以讓我們草擬標籤分類、標註一批試辦資料,並告訴您歧義會出現在哪裡。

在您提供任何資料前先簽署保密協議。試辦範圍的界定不收費。