服務項目
涵蓋各種模態的日文 AI 訓練資料
五項服務對應 AI 系統各階段的需求——從教會模型的指令資料,到告訴您它是否真的有效的人工評測。
五項服務都建立在同一個基礎上:在日本作業的標註人員、以版本管理而非靠記憶維持的標註規範,以及先量測、後宣稱的品質。
一個團隊,涵蓋完整的資料生命週期
多數標註問題並不是「貼標籤」的問題,而是「定義」的問題:兩個同樣講理的人讀同一份標註規範,卻替同一個日文句子貼上不同的標籤,而且在模型把兩者都學進去之前沒有人發現。我們把作業拆成五項服務,正是為了讓這些定義明確化——每項服務有自己的標籤分類問題、自己的失效模式,以及自己的品質檢查。
這五項服務不是必須二擇一的方案包。單一專案經常同時用到其中三項:以 NLP 標註建立帶標籤的語料庫,以 LLM 訓練資料把它轉成指令與偏好配對,再以評測量測最終模型的實際表現。貫穿其中不變的,是底層那份對日文的判斷力。
重點速覽
- 模態
- 日文的文字、語音、影像、影片、文件與多模態資料。
- 模型階段
- 語料篩選、監督式微調、偏好與 RLHF 資料、評測與基準測試。
- 交付格式
- JSONL、CSV、CoNLL-U、SRT、CTM、COCO——或由您定義的 schema。
- 工具
- 我們可在貴團隊的標註平台內作業,也可在我們自己的安全環境中進行。
- 起點
- 一個界定範圍的試辦專案。在放量之前先驗證標籤分類與品質。
我們的服務
五項服務,外加專家層
每一項都有專屬頁面,載明標籤分類決策、日文特有的陷阱,以及交付項目。
LLM 訓練資料
以日文撰寫的指令、偏好與 RLHF 資料集,其中的語體決策都被明確寫下來。
- 指令與 SFT 資料
- 偏好與排序資料
- 多輪對話
- 安全性、拒絕與紅隊資料
LLM 評測
對日文模型輸出的人工評測——評分標準、成對偏好比較、事實查核與紅隊測試。
- 成對偏好比較
- 評分標準評分
- 事實性與依據查核
- 安全性與紅隊測試
語音與音訊
日文 ASR 語音轉寫、語者分段與意圖標註,並把正規化慣例明文寫下來。
- 轉寫
- 時間軸與對齊
- 語者標註
- 意圖與語意槽標註
影像與影片
針對日文影像、影片與紙本文件的定界框、分割、OCR 與版面標註。
- 偵測與分割
- 關鍵點與屬性
- 影片標註
- OCR 與文件版面
文字與 NLP
針對日文文本的實體、關係、意圖與情感標註,斷詞邊界是決定出來的,而不是預設的。
- 具名實體辨識
- 關係與事件抽取
- 分類
- 情感與情緒
專家標註
由日本領域專家執行的標註與評測,服務於受法規管制領域中的 AI。
- 律師
- 稅務師
- 會計師
- 勞務與社會保險專家
如何選擇
我需要哪一項服務?
請從您想改變模型的哪一點出發。服務由目標決定,而不是由您手邊剛好有的檔案類型決定。
| 如果您的目標是… | 對應服務 | 典型的首次交付 |
|---|---|---|
| 讓模型以自然且語體正確的日文回答 | LLM 訓練資料 | 一批試辦的指令–回應配對,附一份定版的風格指南 |
| 在上線前找出模型會出錯的地方 | LLM 評測 | 一份完成評分的評測資料集,附評分標準與評分者間一致率 |
| 讓模型準確聽懂日文語音 | 語音與音訊 | 完成轉寫的音訊,附書面的正規化慣例 |
| 讀懂日文文件、表單或畫面文字 | 影像與影片 | 在具代表性的文件樣本上完成 OCR 與版面標註 |
| 從日文文本中抽取結構化事實 | 文字與 NLP | 一套實體與關係 schema,並以真實邊界案例測試過 |
| 讓專業人士評判受法規管制領域的答覆 | 專家標註 | 一份經專家審查的評測資料集,附書面裁定紀錄 |
生命週期
各服務的定位
同一份資料集很少能同時服務兩個階段。用來教模型的資料,並不適合拿來考模型,因為模型已經看過它了。
-
01
語料準備
對原始日文文本、語音或文件進行篩選、去重規則、品質與安全性標記。決定哪些資料值得標註。
-
02
監督式微調
指令–回應配對、多輪對話與任務示範,皆以產品實際使用的語體撰寫。
-
03
偏好與對齊
排序或成對比較、安全性與拒絕行為,以及界定「哪一則回應比較好」的書面標準。
-
04
評測
由未參與建置訓練資料的人員執行的保留資料集與評分標準評分,確保量測的獨立性。
-
05
上線後監控
抽樣線上模型輸出,以同一套評分標準評分,並把反覆出現的失誤回饋到下一輪資料循環。
交付
格式與交付
每一批交付都附上該批所依據的標籤分類版本,以及相對於前一批的異動紀錄,讓資料集在不同版本間仍可比較。
| 資料類型 | 典型交付格式 | 亦可提供 |
|---|---|---|
| 文字與 NLP | JSONL | CSV、CoNLL-U、brat standoff、Parquet |
| LLM 指令與偏好 | JSONL(messages/chosen–rejected) | CSV、Hugging Face 資料集格式 |
| 語音 | 含時間軸的 JSON | SRT、VTT、CTM、TextGrid、純文字逐字稿 |
| 影像與影片 | COCO JSON | YOLO、Pascal VOC、CVAT XML、逐影格 JSONL |
| 文件與 OCR | 含頁面座標的 JSON | hOCR、ALTO、CSV 欄位抽取 |
| 評測結果 | JSONL 評分加上一份品質報告 | CSV、評分 notebook、裁定紀錄 |
常見問題
關於這些服務
在界定試辦範圍之前常被問到的範圍與流程問題。
可以,而且多數專案都會這麼做。典型的順序是:先以 NLP 標註建立帶標籤的語料庫,再據以建置 LLM 訓練資料,最後由另一組標註人員執行評測。把它們納入同一份合作案,代表標籤分類、風格指南與品質指標能維持一致,而不必在每家供應商處重新推導一次。
日文正是我們的立足點,日英雙語的工作也涵蓋在這個範圍內。至於其他語言的大量作業,我們寧可直接告訴您我們不是合適的供應商,也不願接下案子再轉包出去。
以工作單位計價——每筆項目、每小時音訊、每張影像或每次評測——並取決於任務複雜度、每筆項目所需的審查工時,以及所需的專業程度。我們會先在您的真實資料上界定試辦範圍再報價,因為只憑任務描述給出的報價是猜測,而且通常猜錯。
由我們草擬、由貴團隊審閱,兩者都在量產前完成。試辦的目的就是拿真實的邊界案例去擊破第一版草稿;試辦期間解決的每一次分歧,都會回寫進這份文件。規範隨後會版本化,每一批交付都會記錄它所依據的版本。