服務項目

涵蓋各種模態的日文 AI 訓練資料

五項服務對應 AI 系統各階段的需求——從教會模型的指令資料,到告訴您它是否真的有效的人工評測。

五項服務都建立在同一個基礎上:在日本作業的標註人員、以版本管理而非靠記憶維持的標註規範,以及先量測、後宣稱的品質。

一個團隊,涵蓋完整的資料生命週期

多數標註問題並不是「貼標籤」的問題,而是「定義」的問題:兩個同樣講理的人讀同一份標註規範,卻替同一個日文句子貼上不同的標籤,而且在模型把兩者都學進去之前沒有人發現。我們把作業拆成五項服務,正是為了讓這些定義明確化——每項服務有自己的標籤分類問題、自己的失效模式,以及自己的品質檢查。

這五項服務不是必須二擇一的方案包。單一專案經常同時用到其中三項:以 NLP 標註建立帶標籤的語料庫,以 LLM 訓練資料把它轉成指令與偏好配對,再以評測量測最終模型的實際表現。貫穿其中不變的,是底層那份對日文的判斷力。

重點速覽

模態
日文的文字、語音、影像、影片、文件與多模態資料。
模型階段
語料篩選、監督式微調、偏好與 RLHF 資料、評測與基準測試。
交付格式
JSONL、CSV、CoNLL-U、SRT、CTM、COCO——或由您定義的 schema。
工具
我們可在貴團隊的標註平台內作業,也可在我們自己的安全環境中進行。
起點
一個界定範圍的試辦專案。在放量之前先驗證標籤分類與品質。

如何選擇

我需要哪一項服務?

請從您想改變模型的哪一點出發。服務由目標決定,而不是由您手邊剛好有的檔案類型決定。

把目標對應到服務。多數專案最後會組合其中兩到三項。
如果您的目標是…對應服務典型的首次交付
讓模型以自然且語體正確的日文回答LLM 訓練資料一批試辦的指令–回應配對,附一份定版的風格指南
在上線前找出模型會出錯的地方LLM 評測一份完成評分的評測資料集,附評分標準與評分者間一致率
讓模型準確聽懂日文語音語音與音訊完成轉寫的音訊,附書面的正規化慣例
讀懂日文文件、表單或畫面文字影像與影片在具代表性的文件樣本上完成 OCR 與版面標註
從日文文本中抽取結構化事實文字與 NLP一套實體與關係 schema,並以真實邊界案例測試過
讓專業人士評判受法規管制領域的答覆專家標註一份經專家審查的評測資料集,附書面裁定紀錄

生命週期

各服務的定位

同一份資料集很少能同時服務兩個階段。用來教模型的資料,並不適合拿來考模型,因為模型已經看過它了。

  1. 01

    語料準備

    對原始日文文本、語音或文件進行篩選、去重規則、品質與安全性標記。決定哪些資料值得標註。

  2. 02

    監督式微調

    指令–回應配對、多輪對話與任務示範,皆以產品實際使用的語體撰寫。

  3. 03

    偏好與對齊

    排序或成對比較、安全性與拒絕行為,以及界定「哪一則回應比較好」的書面標準。

  4. 04

    評測

    由未參與建置訓練資料的人員執行的保留資料集與評分標準評分,確保量測的獨立性。

  5. 05

    上線後監控

    抽樣線上模型輸出,以同一套評分標準評分,並把反覆出現的失誤回饋到下一輪資料循環。

交付

格式與交付

每一批交付都附上該批所依據的標籤分類版本,以及相對於前一批的異動紀錄,讓資料集在不同版本間仍可比較。

常見交付格式。自訂 schema 於啟動會議中定義,並與資料一同進行版本管理。
資料類型典型交付格式亦可提供
文字與 NLPJSONLCSV、CoNLL-U、brat standoff、Parquet
LLM 指令與偏好JSONL(messages/chosen–rejected)CSV、Hugging Face 資料集格式
語音含時間軸的 JSONSRT、VTT、CTM、TextGrid、純文字逐字稿
影像與影片COCO JSONYOLO、Pascal VOC、CVAT XML、逐影格 JSONL
文件與 OCR含頁面座標的 JSONhOCR、ALTO、CSV 欄位抽取
評測結果JSONL 評分加上一份品質報告CSV、評分 notebook、裁定紀錄

常見問題

關於這些服務

在界定試辦範圍之前常被問到的範圍與流程問題。

可以,而且多數專案都會這麼做。典型的順序是:先以 NLP 標註建立帶標籤的語料庫,再據以建置 LLM 訓練資料,最後由另一組標註人員執行評測。把它們納入同一份合作案,代表標籤分類、風格指南與品質指標能維持一致,而不必在每家供應商處重新推導一次。

日文正是我們的立足點,日英雙語的工作也涵蓋在這個範圍內。至於其他語言的大量作業,我們寧可直接告訴您我們不是合適的供應商,也不願接下案子再轉包出去。

以工作單位計價——每筆項目、每小時音訊、每張影像或每次評測——並取決於任務複雜度、每筆項目所需的審查工時,以及所需的專業程度。我們會先在您的真實資料上界定試辦範圍再報價,因為只憑任務描述給出的報價是猜測,而且通常猜錯。

由我們草擬、由貴團隊審閱,兩者都在量產前完成。試辦的目的就是拿真實的邊界案例去擊破第一版草稿;試辦期間解決的每一次分歧,都會回寫進這份文件。規範隨後會版本化,每一批交付都會記錄它所依據的版本。

從這裡開始

告訴我們模型需要學會什麼。

請提供任務、一份資料樣本,以及您面臨的限制條件。我們會回覆一份界定範圍的試辦計畫、我們需要釐清的標籤分類問題,以及對困難之處的誠實評估。

在您提供任何資料前先簽署保密協議。試辦範圍的界定不收費。