偵測與分割
依量產前議定的類別分類,標註定界框、旋轉框、多邊形與像素層級遮罩。
- 2D 與旋轉定界框
- 多邊形與實例分割
- 語意分割
- 遮擋與截斷旗標
視覺與多模態
定界框、多邊形、分割、關鍵點、影片追蹤、OCR 與文件版面——處理的是畫面中文字為日文、文件遵循日本商務慣例的資料。
多數視覺標註與語言無關。但只要畫面裡出現文字,或頁面上是一張日本表單,它就會很快地不再與語言無關。
在車子外圍畫一個框,在哪個國家都是同一件事;讀懂一張日本收據上的文字則不然。日文文件直書與橫書一樣常見,同一行內混用四套文字系統,使用全形拉丁字母與數字,在被注音的詞上方標注假名,並在西式表單預期簽名的位置蓋上公司印章。
文件 AI 專案栽的通常是這些細節,而不是模型本身。把一個直書欄位當成五行分開處理的版面標註,或是把全形數字默默轉成半形的 OCR 轉錄,產出的訓練資料教給模型的,就不是您原本想教的東西。
畫面文字與街景文字也是如此:店家招牌、商品包裝、菜單與車站看板上,滿是通用標註規範根本沒有處理過的日文排版樣式。
重點速覽
任務類型
幾何、類別與文字是分開的層級,也分開審查。
依量產前議定的類別分類,標註定界框、旋轉框、多邊形與像素層級遮罩。
為姿態、商品狀態、狀況分級等細粒度工作,標註特徵點位置與各物件的屬性。
跨影格追蹤物件並維持穩定的身分,並對動作與事件做時間軸切分。
在日本商務文件上進行文字區域偵測、閱讀順序、文字轉錄與結構角色標註。
把文件轉成結構化的值——哪段文字是總金額、哪個日期是開立日、哪些明細列屬於同一組。
日文特有事項
日文影像與文件資料上,四個反覆出現的失效點。
日文既可由上到下、由右到左,也可由左到右書寫,而同一頁常常兩者混用。假設文字為橫排的工具,會產出一個「錯得很有自信」的閱讀順序。
我們的處理方式 閱讀順序是明確標註出來的,而不是從幾何位置推測,並訂有混合方向頁面、注音文字與多欄版面的規則。
印在漢字詞上方或旁邊的小假名是讀音註記,不是額外的內容。若把它們照原位轉錄進去會汙染文字;若不加思索地丟掉,又會失去您可能需要的資訊。
我們的處理方式 注音文字會以連結標註的形式掛在其對應的本文上,讓下游可以保留、捨棄或當作讀音標籤使用,不必重新標註。
A123 與 A123 看起來幾乎一樣,卻是不同的字元。這裡若不控管正規化,是日文 OCR 資料集中最常見的隱性缺陷之一。
我們的處理方式 轉錄慣例明確載明哪些字元會被正規化、哪些必須原樣保留,並在交付前以自動檢查強制執行。
日本的發票、收據與申請書有自己的一套結構用語——御中、但し書き、公司印章、以年號紀年的日期,以及並列的含稅與未稅總額。
我們的處理方式 欄位 schema 依貴團隊文件類型的真實範例建立,年號日期、印章區域與稅額處理都被定義為一級欄位,而不是自由文字。
流程
在任何人開始大量標註之前,先在真實樣本上把標籤分類與幾何規則定下來。
我們先標註一小批具代表性的資料,找出模稜兩可的情況——什麼算是一個物件、物件在畫面邊緣時怎麼處理、類別確實不明時該怎麼辦。
框的貼合程度、遮擋處理、最小物件尺寸、截斷、群體物件,以及無法辨讀文字的處理方式,全都以書面固定下來。
數位標註人員各自獨立標註相同影像。我們會量測幾何一致率,一致率偏低之處,就代表規則有模糊地帶。
幾何與標籤分成兩輪審查,因為「框得很準但類別錯了」與「類別對但框得鬆散」是兩種不同的缺陷。
標註成果以貴團隊的格式交付,並附上標籤分類版本、各類別數量與該批次的品質報告。
交付
我們直接匯出成貴團隊訓練管線的原生格式,不需要您另外寫轉換程式。
| 任務 | 預設輸出 | 亦可提供 |
|---|---|---|
| 偵測與分割 | COCO JSON | YOLO、Pascal VOC、CVAT XML、PNG 遮罩 |
| 關鍵點與屬性 | COCO keypoints JSON | CSV、自訂 JSON schema |
| 影片追蹤 | MOT 格式 | 逐影格 COCO、CVAT XML |
| OCR 與版面 | 含頁面座標的 JSON | hOCR、ALTO、PAGE XML |
| 欄位抽取 | JSONL,每行一份文件 | CSV、貴團隊的文件 AI schema |
品質
視覺缺陷很擅長藏起來。以下這些檢查,能在訓練之前先把它們挖出來。
常見問題
日文視覺與文件 AI 工作的常見問題。
可以——手寫的表單填寫內容、地址、姓名與自由填答意見都能處理。手寫比印刷慢,歧義率也確實更高,因此我們會標記不確定的字元而不是用猜的;並且事先議定:無法辨讀的欄位是盡力轉錄,還是標記為無法辨讀。這個決定對您的模型而言,比原始正確率數字更重要。
可以。我們能在客戶提供的平台內作業——包括 CVAT、Label Studio、SageMaker Ground Truth、Labelbox 與內部自建工具——若您不方便開設帳號,我們也可在自己的安全環境中進行。用哪個平台不會改變標註規範或審查流程。
可以,而且在大量的偵測工作上,這往往是合理的做法。風險在於修正這一關會繼承模型的盲點,因此我們會拿它與從零標註的樣本比對,告訴您它實際抓出了什麼。至於日文文件的 OCR,我們比較保守,因為全形字元與直書文字上的模型錯誤在螢幕上很容易被看漏。
在保密協議與資料處理協議之下,於隔離環境中作業,存取權限僅限專案成員。我們也能標註個人資料以供遮蔽,或只處理您在寄送前已遮蔽過的材料。保存與刪除條款寫進合約,而不是交由內部政策決定。
日本文件常使用年號紀年——例如寫成令和6年而非 2024——而且同一頁常常兩種並存。我們把年號日期視為獨立欄位,保留原始字串,並在您需要時附上正規化後的西元值,讓轉換過程不會遺失資訊,也不會把轉換錯誤固化進資料裡。