品質架構

我們如何量測標註品質

品質要嘛是一個您能據以行動的數字,要嘛只是一種意見。本頁明確說明我們產出哪些數字、如何計算、它們能告訴您什麼、又不能告訴您什麼,以及每一批交付所附的品質報告裡有什麼。

本網站上作為示例呈現的每一個數字,都標明為示例。我們不公布準確率保證,因為在看到您的資料之前就給出的保證不是承諾——那是行銷數字。

品質是設計出來的,不是檢查出來的

最終檢查這一關可以抓出錯誤,卻抓不出歧義,而真正讓日文資料集劣化的正是歧義。如果標註規範容許某個案例有兩種讀法,兩種讀法都會通過檢查,而這份不一致就會帶著一張乾淨的健康證明進入訓練資料。

所以決定品質的工作發生在標註之前:撰寫標註規範、在試辦中用真實邊界案例把它擊破、量測獨立作業的標註人員是否收斂,並在不收斂的地方修正規範。審查是第二道防線,不是第一道。

以下是整套體系,包含那些寫出來會讓人不太舒服的部分——每個指標抓不到什麼,以及數字看起來很健康、資料集卻不健康的情況。

重點速覽

量測項目
標註者間一致率、實測的黃金樣本正確率、裁定比例與標籤偏移。
呈報單位
以批次為單位,並依標籤與各項標準細分,而不是混成單一數字。
審查深度
依專案設定。需要判斷之處審得深,任務機械化之處審得淺。
分歧處理
由資深審查者以書面裁定,並回寫進標註規範。
我們不做的事
公布準確率保證,或引用在其他專案上量得的數字。

體系

六個階段,持續運轉

這個循環貫穿整個專案期間,而不是開頭跑一次就結束。

  1. 01

    訂規格

    標註規範會針對任務所需的每一項決策,寫上實作範例與反例。任何在此保持隱性的東西,日後都會變成不一致。

  2. 02

    校準

    標註人員各自獨立標註同一批校準資料。分歧指出規範模糊之處——我們修正的是規範,不是標註人員。

  3. 03

    標註

    量產作業,並逐筆記錄所依據的規範版本,讓日後針對某筆紀錄的疑問能被精確回答。

  4. 04

    審查

    由第二位標註人員以任務所需的深度進行審查。審查是有自己標準的獨立角色,不是把標註再快跑一遍。

  5. 05

    裁定

    分歧交由資深審查者處理,並記錄裁定結果與理由。每一次裁定都會成為標註規範中的實作範例。

  6. 06

    量測與回饋

    一致率、黃金樣本正確率與偏移逐批計算,與先前批次比較,並據以決定下一次規範修訂該從哪裡下手。

指標

每個數字實際代表什麼

在此先行定義,讓品質報告中的數字不必再問我們就能讀懂。

標註者間一致率
獨立作業的標註人員對同一筆項目給出相同標籤的頻率。呈報時會同時列出原始一致率與經機率校正的係數,因為在類別分布失衡的標籤分類上,原始一致率可以看起來極佳卻幾乎不帶任何資訊。
Cohen κ/Krippendorff α
經機率校正的一致度係數。兩位標註人員標註類別型標籤時使用 Cohen κ;當標註人員超過兩位、存在缺漏判斷或使用序位量表時,則使用 Krippendorff α。報告中會載明採用哪一種,而不是含混帶過。
黃金樣本正確率
對照由資深審查者標註並裁定過的參考資料集所得的正確率。它量的是正確性而非一致性——兩位標註人員可以完全一致卻同時是錯的,而這件事單看一致率統計永遠看不出來。
裁定比例
需要資深審查者出面解決的項目占比。裁定比例上升,通常是資料已經改變或規範存在缺口的最早訊號,而且它會比正確率更早動起來。
標籤偏移
標籤分布或標註人員行為隨時間產生的變化。長期專案會因為一般原因而偏移——來源資料改變、標註人員變得更有把握——而偏移監控正是用來把這類偏移與真正的劣化區分開來。
邊界一致率
在範圍型任務中,標註人員對範圍起訖位置的一致程度,與標籤是否一致分開呈報。一份日文範圍標註資料集可能標籤一致率極佳,邊界卻不堪使用。

品質總覽

品質儀表板範例

一致率

97.8%

2.1% 較前 7 天

黃金樣本準確率

98.6%

1.4% 較前 7 天

已審查筆數

24826

18.7% 本週

未解決分歧

18

12 較前 7 天

標籤偏移(30 天)

觀測到的偏移 警示門檻
0%2.5%5% Day 1Day 8Day 15Day 22Day 30

品質摘要

  • 規範遵循度
  • 審查者校準
  • 離群值監控
  • 偏移偵測

介面示意。圖中數字為說明品質監控方式的範例資料,並非已公布的實際成果。

審查

一個批次中有多少會被審查

審查深度是專案設定,與您議定並載入合約。審得越重不見得越好——一項機械化的任務若以最高深度審查,等於把預算花在不需要判斷的地方。

示意性的審查配置。專案實際的深度於範圍界定期間議定。
審查深度典型適用於實際做法
抽樣審查一致率穩定的大量機械性任務審查既定比例的項目;發現不合格則擴大審查範圍
全量二次審查仰賴判斷的標註,以及多數日文範圍標註工作每一筆項目都由第二位標註人員審查
盲雙重標註評測資料集、基準測試與黃金樣本兩位標註人員獨立作業;所有分歧都經過裁定
專家審查受法規管制的領域與需要專業判斷之處由領域專家審查,對有爭議的項目附書面理由

錯誤分類

替失誤命名

有名字的缺陷才能被計數、看趨勢、被修好。籠統的「錯誤」總數無法告訴您該改什麼。

規範缺口

該案例不在標註規範涵蓋範圍內。修法是修訂規範,而不是修正該筆項目——否則同樣的案例還會再出現。

規範誤用

該案例有涵蓋,但標註人員套錯了規則。以回饋修正;若反覆出現,則補上更清楚的實作範例。

邊界錯誤

標籤對了,範圍不對。這是日文範圍標註工作特有的問題,邊界規則與斷詞在此互相作用。

語體或語感錯誤

語言上正確,社會層面卻不對:禮貌程度用錯,或是拒絕柔和到讀不出是拒絕。

事實錯誤

可查證的陳述、名字讀音或數字有誤。與判斷類錯誤分開,因為它的修法是查證,不是校準。

來源缺陷

項目本身無法使用——聽不清楚的音訊、無法辨讀的掃描件、語意不明的提示。標記後回報,絕不用看似合理的猜測填補。

呈報

每一批交付會附上什麼

這份報告的設計目的,是讓您在我們不在場的情況下也能稽核該批次。

  • 依標籤或標準分別列出的一致率數字,並明確載明所使用的係數。
  • 該批次的黃金樣本正確率,以及相對於先前批次的趨勢。
  • 裁定比例,附裁定紀錄與每一次裁定所記錄的理由。
  • 依上述分類細分的錯誤數量,而不是一個籠統的缺陷總數。
  • 該批次所依據的標註規範版本,以及相對於前一版的異動紀錄。
  • 被標記為來源缺陷的項目會逐一列出,而不是悄悄剔除。

常見問題

關於品質量測

關於這些數字能證明什麼、又不能證明什麼的問題。

我們不公布準確率保證,而且任何供應商給出的保證,我們都會謹慎看待。可達成的準確率取決於任務、標籤分類、來源資料的品質,以及該領域本身含有多少真正的歧義——這些在試辦之前一項都不知道。我們承諾的是量測方法:用哪些指標、如何計算、以什麼頻率呈報,以及某一批未達標時會怎麼做。在您的資料上做過試辦之後,我們就可以談實際可行的目標,因為到那時才有真的東西可談。

那是範例資料。它們的作用是呈現介面會報出什麼、以及這些指標運作起來的樣子,正因如此,它們旁邊有明顯的標示與免責說明。它們不是任何客戶專案的成果,我們也不會把它們當成成果來呈現。

單看它並不成立。一致率量的是一致性,不是正確性——抱著同一個誤解的標註人員會完全一致。它也會被失衡的標籤分類灌水,因此我們在原始一致率之外一併呈報經機率校正的係數;也因此才有由資深審查者裁定的黃金樣本,作為對正確性的獨立檢核。

它不會交付。視失誤性質而定,處理方式可能是針對性的重新標註、先修訂規範再重做受影響的項目,或是在成因來自上游時上呈給您——例如標籤分類有歧義,或來源資料根本撐不起這項任務。我們寧可晚交並附上說明,也不願準時交出一個一碰到您的模型就站不住腳的數字。

可以,而且這是合理的要求。您可以查閱標註規範及其版本歷程、取樣自行評分,並把您的結果與我們呈報的數字比對。當客戶並行執行自己的品質檢查時,我們把兩邊的差異視為值得調查的發現,而不是需要爭論的糾紛。

品質

請我們在您自己的資料上跑出數字。

一次試辦會產出真實的一致率數字、真實的錯誤細分,以及對「您的標籤分類哪些部分在量產時撐得住」的誠實評估。

在您提供任何資料前先簽署保密協議。試辦範圍的界定不收費。