成對偏好比較
對同一個提示的兩則回應,依書面標準進行比較。這是比較模型版本最穩健的方式,因為相對判斷遠比絕對分數穩定。
- A/B 模型比較
- 明確記錄平手
- 各項標準的偏好
- 控制位置偏誤的排列順序
評測與人類回饋
針對您的模型在日文中實際產出的內容,做出結構化的人類判斷——由母語者依書面評分標準評分,量測一致率,並以書面裁定分歧。
一次評測的品質,不會超過它的評分標準。如果兩位稱職的日文母語者對同一則回應給出不同分數卻說不出理由,得出的數字只是披著小數點的雜訊。
自動化指標與以 LLM 當評審的做法,用來追蹤趨勢很有用,但對日文中最要緊的那類失誤並不可靠。一個主要以英文訓練出來的評審模型,會很樂意通過一則禮貌程度不合場合的回應、一則柔和到不像拒絕的拒絕,或一則敬語與三輪前建立的關係互相矛盾的回應。這些正是日文使用者一眼就看出、而指標完全看不出的錯誤。
因此我們以一位細心審查者的方式進行評測,但讓審查過程可重現:附有實作範例的錨定式評分標準(每個分數級距都有例示)、評分開始前的校準、對樣本進行盲雙評,以及評分者意見不一時的書面裁定。產出的是一組您站得住腳的數字,連同產生這些數字的推理過程。
我們也把獨立性當作設計上的硬性條件。專案的評測人員不會是撰寫該專案訓練資料的人,因為替自己參與制定的規範打分數,往往會打得比較寬鬆。
重點速覽
評測類型
不同的問題需要不同的工具。多數專案會針對同一個模型執行其中兩到三項。
對同一個提示的兩則回應,依書面標準進行比較。這是比較模型版本最穩健的方式,因為相對判斷遠比絕對分數穩定。
針對具名標準給出絕對分數——正確性、有用性、語體、排版、安全性——每一項都附有錨定描述,說明某個分數代表什麼。
一項陳述是否為真,以及它是否真的有模型所取得的段落作為依據。這是兩種不同的失誤,分開計分。
由日文母語者以日文撰寫的對抗式提示,包含翻譯而來的提示集永遠不會有的間接與委婉說法。
為您的領域打造的保留評測資料集,題目的設計目的是拉出差異,而不是讓每個模型都答對。
日文特有事項
以下每一項,對以英文訓練的評審模型都是隱形的,對日文讀者卻一目瞭然。
一則回應可以文法正確、內容無誤,卻仍然是錯的——因為它用對同事說話的語體去對顧客說話。日文的禮貌程度是正確性的一個維度,不是文體偏好。
我們的處理方式 語體是評分標準中具名的一項,有自己的錨定描述,與正確性分開計分,讓內容紮實但語體失當的答覆無法躲在內容後面。
日文的拒絕預設是間接的。模型若以難しいかもしれません回應一個禁止的要求,技術上算是打了太極,而許多評測設計會把它算成一次成功的拒絕。
我們的處理方式 拒絕的計分依據是「日文母語者是否會把它讀成拒絕」,量表附有實作範例;而過度拒絕則被當成另一種失誤計分,不算成功。
對話早期確立的關係,會約束之後的每一輪。模型經常在對話中途把它重設,這在日文使用者讀來,就像助理忘了自己在跟誰說話。
我們的處理方式 多輪項目以整段對話為單位計分,一致性標準是跨輪次檢視,而不是孤立地看每一則回應。
日文的專有名詞有多種有效讀法,模型若讀錯人名或地名,那是拼字檢查看不出來的事實錯誤。
我們的處理方式 實體與讀音錯誤屬於事實性底下的獨立子類別,會依日文來源查證,而不是憑評測人員的記憶。
流程
評分標準是比這次評測活得更久的交付物。它讓下一次評測能與這一次相互比較。
我們把貴團隊在意的品質問題轉成具名標準,再用貴團隊模型輸出的真實例子,為每個分數級距寫出錨定描述。
提示以抽樣或撰寫的方式涵蓋您在意的行為,包含隨機抽樣永遠碰不到的罕見與對抗式案例。
每位評測人員都對同一批校準資料評分。有分歧就討論,並把評分標準的錨點磨得更利,直到一致率穩定後才開始正式評分。
一定比例的題目由兩位評測人員盲評。出現分歧時交由資深審查者處理,並記錄裁定理由。
您收到的是分數、一致率統計、裁定紀錄,以及一份說明反覆出現之失誤型態的書面摘要——而不只是排行榜上的一行。
交付
每一個分數都可追溯到題目、評測人員角色、評分標準版本,以及(若有撰寫的話)評分理由。
| 交付項目 | 格式 | 內容 |
|---|---|---|
| 逐題分數 | JSONL 或 CSV | 題目 id、各標準分數、理由、評測人員角色、評分標準版本 |
| 一致率報告 | PDF 或 Markdown | 各標準的評分者間一致率、裁定比例、整場評測的偏移情形 |
| 失誤分析 | PDF 或 Markdown | 反覆出現的型態、各型態的實例、建議的規範或資料調整 |
| 紅隊測試發現 | JSONL | 提示、回應、類別、嚴重程度、重現說明 |
| 基準資料集 | JSONL 加評分程式 | 題目、參考答案、可接受變體、評分腳本 |
品質
沒有一致率統計的評測只是意見。以下這些檢查,才把它變成一次量測。
常見問題
團隊在委託第一次日文評測前會問的問題。
LLM 評審便宜、快速,用來追蹤版本之間的回歸很有用。但它們恰恰在日文最困難的地方不可靠——禮貌程度是否合宜、拒絕的強度、敬語的一致性與人名讀音——因為這些判斷仰賴母語者的語用知識。常見的搭配方式是:以人工評分的資料集作為基準,用 LLM 評審跑頻繁的例行評測,再定期以人工重新評分,確認評審模型沒有偏離基準。
取決於您需要偵測多大的差異,以及要評幾項標準。幾百題精選的題目通常足以分辨兩個明顯不同的模型;要區分幾乎等價的檢查點則需要多得多。我們會依您想做的決策來決定資料集規模,若資料集小到撐不起您想得出的結論,我們也會直說。
可以。對於法律、稅務、會計、勞務或公司登記等主題,我們會依任務所需的專業組建評測團隊。我們不維持常設的持照專業人員名單——人力可得性會依每個專案的範圍、資料量與時程逐案評估,並在開始作業前先確認哪些是做得到的。
會,但不會由同一批人執行。專案的評測人員與撰寫該專案訓練資料的標註人員是分開的,因為對照自己協助撰寫的規範打分數,並不是獨立的量測。如果您希望評測完全由產出資料的供應商之外的一方進行,我們認為那是合理的立場,也會如實表達。
照實呈報結果,並附上解釋結果的失誤分析。只有一個分數的報告無法據以行動——您需要的是分數背後反覆出現的型態、每一種型態的實例,以及對「該補資料、該改規範,還是該改產品」的具體看法。我們寧可把不中聽的發現講清楚,也不會把它說得婉轉一點。