01
LLM 與生成式 AI
- 指令微調資料
- RLHF/偏好資料
- 安全性與紅隊測試
- 評測資料集
在日本執行的 AI 資料作業
為 LLM、NLP、語音、視覺與多模態 AI 提供高品質日文訓練資料,全程由日本在地的專業人員標註與審查。
日文原文
それはちょっと難しいです
備註(選填)
在此加註說明…
情境
一段對話中,說話者正委婉拒絕同事的提案。
說話者意圖
在顧及對方感受的前提下拒絕該提案。
標籤
+ 新增標籤
介面示意——範例任務,非客戶實際資料。
日文母語人員
在日本作業的標註人員,理解語言、文化與語感。
多層品質審查
專家複審、共識檢核與持續的品質校準。
企業級資訊安全
嚴格的存取控管、加密與安全的作業流程。
彈性規模
從試辦專案到量產規模的標註作業。
大丈夫です。
Daijōbu desu.
將游標移到任一語意,即可看到決定它的語境。
服務能力
涵蓋文字、語音、視覺與多模態日文資料的標註作業,可交付 JSONL、CSV、CoNLL-U 或貴團隊自訂的 schema。
01
02
03
04
領域專家標註
專業領域的 AI,需要同樣專業的人類知識。我們會依專案真正需要的領域專業組建標註與評測團隊——從法律、稅務到會計、勞務、金融等各個領域。
在受法規管制的領域中運作的 AI,光有流利的日文並不夠,還需要懂得該領域術語、法規、作業流程與判斷標準的人。對於需要日本在地專業知識的 AI 專案,我們提供由專家主導的標註、評測、查核與資料集建置。
弁護士
日本法律、合約、法規與法律推理。
税理士
日本稅制、報稅程序與稅務專業知識。
公認会計士
會計準則、財務報表、審計與企業財務。
社会保険労務士
專責勞動法令與社會保險事務的日本專業資格(Sharoshi)
勞動法規、社會保險、薪資計算與人資法遵。
司法書士
公司登記、不動產登記與相關法律程序。
術語、敬語程度與邊界案例因產業而異。我們會在量產開始前,與貴團隊一起建立詞彙表。
我們並未常設持照專業人士的固定名單。每個標註團隊都是依專案所需的專業另行組建,能否安排則依專案的範圍、資料量、專業程度與時程逐案評估。若貴團隊的專案無法找到具備該項資格的人員,我們會在專案開始前告知。
專業層級
並非每項任務都需要專家複審。我們會依任務真正需要的程度配置專業層級,讓預算花在真正需要判斷的地方。
層級 01
適用於需要日文能力、但不需專業領域知識的任務。
層級 02
適用於需要特定產業實務或學術知識的任務。
層級 03
適用於需要高階領域知識、實務經驗或特定專業資格的任務。
流程
可重複執行的作業流程,每一步都有明確的交付物,讓品質是設計出來的,而不是最後才檢查出來的。
共同確立目標、資料 schema 與標註規範。
由日本在地標註人員產出高品質標籤。
專家複審驗證結果,並裁定邊界案例。
持續量測、分析並校準標註品質。
以貴團隊指定的格式交付可直接訓練的資料。
品質
我們在每個環節量測品質,並與您分享真正重要的指標。
標註者間一致率、黃金樣本準確率與明文化的錯誤分類,讓品質從主觀意見變成可以據以行動的數字。每一次意見分歧都以書面裁定,並直接回寫進標註規範。
我們的品質架構一致率
97.8%
2.1% 較前 7 天
黃金樣本準確率
98.6%
1.4% 較前 7 天
已審查筆數
24826
18.7% 本週
未解決分歧
18
12 較前 7 天
介面示意。圖中數字為說明品質監控方式的範例資料,並非已公布的實際成果。
人機協作
AI 的速度,加上人的判斷——這就是人機協作。
人機
協作
資訊安全
企業級的資訊安全,以及完全透明的做法。
我們簽署保密協議(NDA)與資料處理協議,保護貴公司的機密資訊。
以角色為基礎的權限、最小權限原則,並強制多因素驗證。
隔離的作業環境,傳輸中與靜態資料皆加密。
保存期限控管、安全刪除與可稽核的日誌。
控管措施依每個合作案議定,並載明於合約。我們只描述實際執行的做法——若貴團隊需要特定的認證或稽核標準,請直接詢問,我們會明確告知是否具備。
實績
為日文模型訓練設計的高品質指令與偏好資料,安全規範與版本化的標籤分類在進入量產前即已定案。
針對日文文件、表單與結構化擷取情境的端到端標註,涵蓋實體、欄位與關係標籤。
以上為匿名化範例,用以說明我們承接的工作類型。客戶名稱與數字依保密協議不予揭露。
常見問題
若這裡沒有涵蓋到,歡迎連同需求一起寄來,我們會直接回覆。
我們涵蓋正式與非正式日文,包含漢字、平假名、片假名與羅馬字,也涵蓋敬語語體、地區差異、俚語與產業術語。標點、表情符號與全形字元的正規化規則會在啟動會議中議定,讓斷詞結果保持一致。
交期取決於資料量、語言複雜度與品質審查深度。我們會先界定試辦範圍,在貴團隊的實際資料上量測真實產能,再據此承諾交付計畫,而不是憑臆測。
沒有固定的最低量。我們支援小規模試辦,也能擴展到大量的量產計畫;實務上的最低量取決於任務複雜度與工具建置。
可以。我們能在客戶提供的工具與平台上作業;若貴團隊不希望開設帳號,也可以在我們自有的安全標註環境中進行。
JSONL、CSV、CoNLL-U,以及在啟動會議中定義的自訂 schema。每批交付都會附上標籤分類的版本與變更紀錄。
修訂會走與首次標註相同的品質流程。變更紀錄、品質報告與針對性的重新標註,讓資料集在不同版本之間保持一致,而不是逐批偏移。
簽署保密協議與資料處理協議、以角色為基礎的最小權限存取、隔離的作業環境,以及依貴團隊要求訂定的保存與刪除政策。
支援——指令微調資料、偏好與排序標註、安全性與紅隊測試標註、評測資料集,以及以人機協作方式審查日文的模型輸出。
可以——若專案有這個需求,我們會依所需的領域專業組建團隊,成員可包含在法律、稅務、會計、勞務與社會保險或公司登記等領域具備相關資格或實務經驗的人員。我們並未常設固定名單;能否安排會依每個專案的範圍、資料量與時程逐案評估,並在開始前先確認實際可行的範圍。
可以。專家標註人員能就事實正確性、推理品質、專業妥適性,以及是否符合貴團隊的評分標準,為生成的回答評分;也能產出 RLHF 所需的偏好排序,並支援基準資料集、RAG 評測與紅隊測試。
規範會在啟動會議中擬定,於試辦期間用真實的邊界案例進行壓力測試,再定版為版本化文件。審查中裁定的每一次分歧,都會回寫進這份文件。
您的 AI 需要日本在地的專業嗎?
我們會依您的領域、資料、品質要求與規模,設計對應的標註與評測流程——從一般標註,到領域專家評測。
告訴我們資料的樣貌,我們會回覆一份界定範圍的試辦計畫。