质量体系

我们如何度量标注质量

质量要么是一个您能据以行动的数字,要么就只是一种意见。本页说明我们究竟产出哪些数字、它们是怎么算出来的、它们能告诉您什么、不能告诉您什么,以及每批数据的质检报告里会有什么。

本站上作为示例展示的每一个数字,都明确标明是示例。我们不公布准确率保证,因为在没看到您的数据之前给出的保证不是承诺——那是一个营销数字。

质量是设计进去的,不是检查出来的

最后一道检查能抓出错误,却抓不出歧义,而真正让日语数据集劣化的正是歧义。如果规范允许对某个情形有两种读法,那么两种读法都能通过检查,这份不一致就会带着一张健康证明进入训练数据。

所以决定质量的工作发生在标注之前:撰写规范、在试点中用真实的边界案例把它打破、度量独立标注的人是否收敛,并在他们不收敛的地方修改规范。复核是第二道防线,不是第一道。

以下是整套体系,包括那些公布出来并不好看的部分——每个指标抓不到什么,以及在哪些情况下数字看着健康、数据集其实并不健康。

要点速览

度量对象
标注者间一致性、实测的金标准集准确率、裁定率与标签漂移。
报告粒度
按批次报告,并按标签、按维度拆解,而不是给出一个混合数值。
复核深度
按项目设定。需要判断的地方复核得更深,机械性任务则更轻。
分歧处理
由资深复核员以书面形式裁定,并回写到标注规范中。
我们不做的事
公布准确率保证,或者引用在另一个项目上测得的数字。

体系

六个阶段,持续运转

这个闭环贯穿整个项目周期,而不是开头跑一次就完了。

  1. 01

    定义规格

    规范会为任务所需的每一个决定写上正例与反例。凡是在这里被留成隐含的,之后都会变成不一致。

  2. 02

    校准

    标注员各自独立标注同一份校准集。分歧指明了规范在哪里有歧义——要改的是规范,不是标注员。

  3. 03

    标注

    量产作业,逐条记录所依据的规范版本,这样日后对某条记录有疑问时能准确回答。

  4. 04

    复核

    由第二名标注员按任务所需的深度复核。复核是一个有自身指标的独立角色,而不是把标注再快速做一遍。

  5. 05

    裁定

    分歧交由资深复核员处理,记录裁定结果与理由。每一次裁定都会成为规范中的一个实例。

  6. 06

    度量与回流

    一致性、金标准集准确率与漂移按批次计算,与之前的批次比较,用来判断下一版规范该改哪里。

指标

每个数字究竟意味着什么

在这里定义清楚,是为了让质检报告里的一个数值无需再问我们它指的是什么。

标注者间一致性
独立作业的标注员对同一条目给出相同标签的比例。我们会同时报告原始一致率与一个经机遇校正的系数,因为在类别分布不均衡的体系上,原始一致率可以看着很漂亮,却几乎不携带任何信息。
Cohen’s κ / Krippendorff’s α
经机遇校正的一致性系数。两位标注员标注类别标签时用 Cohen’s κ;标注员超过两位、存在缺失判断或使用有序量表时用 Krippendorff’s α。报告中会写明用的是哪一个,而不是留给人猜。
金标准集准确率
相对于由资深复核员标注并裁定的参考集的准确率。它度量的是正确性而非一致性——两位标注员完全可以一致,而且一起错,这一点单看一致性统计永远看不出来。
裁定率
需要资深复核员出面解决的条目所占比例。裁定率上升,通常是数据发生了变化或规范存在缺口的最早信号,而且它比准确率更早动。
标签漂移
标签分布或标注员行为随时间发生的移动。长周期项目会因为一些寻常原因而漂移——源数据变了、标注员变得更有把握——而漂移监控正是把这类情况与真正的劣化区分开来的手段。
边界一致性
对区间类任务而言,标注员在区间起止位置上的一致程度,与他们是否在标签上一致分开报告。一个日语区间数据集完全可能标签一致性很高,边界却根本没法用。

质量总览

质检看板示例

一致性

97.8%

2.1% 较过去 7 天

金标准集准确率

98.6%

1.4% 较过去 7 天

已复核条目

24826

18.7% 本周

待裁定分歧

18

12 较过去 7 天

标签漂移(30 天)

实测漂移 告警阈值
0%2.5%5% Day 1Day 8Day 15Day 22Day 30

质量摘要

  • 规范遵循度
  • 审核员校准
  • 离群值监控
  • 漂移检测

界面示意。图中数字为示例数据,仅用于说明我们如何监控质量,并非已取得的实际结果。

复核

一个批次中有多少会被复核

复核深度是一项项目级设置,与您商定并写入合同。并非越重越好——一个机械性任务按最高深度复核,等于把预算花在了不需要判断的地方。

示意性的复核配置。项目的实际深度在范围界定阶段商定。
复核深度通常用于具体做法
抽样复核一致性稳定的大批量机械性任务按既定比例抽取条目复核;出现不合格则触发更大范围的复核
全量二次复核依赖判断的标注,以及大多数日语区间类工作每一条都由第二名标注员复核
盲评双标注评测集、基准测试集与金标准集两位标注员独立作业;所有分歧全部裁定
专家复核受监管领域与需要专业判断的场景由领域专家复核,对有争议的条目附书面理由

错误分类体系

给失效命名

一种有名字的缺陷才能被计数、看趋势、被修掉。一个笼统的“错误”总数,没法告诉您该改什么。

规范缺口

规范没有覆盖到这个情形。修的办法是改规范,而不是改这一条——否则同样的情形还会再出现。

规范误用

情形已被覆盖,但标注员把规则用错了。通过反馈来修正;如果反复出现,就补一个更清楚的实例。

边界错误

标签对了,区间不对。这是日语区间类工作特有的问题,边界规则与分词方式在这里相互作用。

语体或细微差别错误

语言上正确,社交上错误:礼貌层级用错,或者拒绝柔和到读不出是在拒绝。

事实性错误

某个可核实的说法、名字读法或数字是错的。它与判断类错误分开,因为修它靠的是核实,而不是校准。

源数据缺陷

条目本身无法使用——听不清的音频、看不清的扫描件、有歧义的提示词。会被标记并如实退回,绝不用一个看起来合理的猜测填上。

报告

每批数据随附什么

这份报告的设计目标是:即使我们不在场,您也能自行审计这一批数据。

  • 按标签或按维度给出的一致性数值,并明确写出所用的系数。
  • 该批次的金标准集准确率,以及相对之前批次的趋势。
  • 裁定率,附裁定记录与每一次裁定所记录的理由。
  • 按上述分类体系拆分的错误计数,而不是一个笼统的缺陷总数。
  • 该批次所依据的规范版本号,以及相对上一版本的变更记录。
  • 被标记为源数据缺陷的条目,会列出来,而不是悄悄丢掉。

常见问题

关于质量度量

关于这些数字能证明什么、不能证明什么的问题。

我们不公布准确率保证,而且对任何供应商给出的这类保证,我们都会持谨慎态度。可达到的准确率取决于任务、标签体系、源数据质量,以及这个领域本身含有多少真正的歧义——在试点之前,这些都是未知数。我们承诺的是度量方法:用哪些指标、怎么计算、以什么频率报告,以及某一批不达标时会怎么处理。在您的数据上做完试点之后,我们就可以谈实际可行的目标了,因为到那时才有真东西可谈。

它们是示例数据。它们的作用是展示界面会报告什么、这些指标动起来是什么样子,也正因如此,它们旁边有醒目的标记与免责说明。它们不是来自客户项目的结果,我们也不会把它们当作结果来呈现。

单凭这一点并不能。一致性度量的是一致,不是正确——共享同一个误解的标注员会完全一致。它也会被分布不均衡的标签体系抬高,所以我们会在原始一致率之外报告一个经机遇校正的系数,也正因如此,才需要由资深复核员裁定的金标准集来独立检验正确性。

它不会交付。视失效原因,处理方式可能是针对性重标注、先改规范再返工受影响的条目,或者在原因出在上游时上报给您——比如标签体系有歧义,或者源数据支撑不了这个任务。与其准时交付一个撑不过与您模型对接的数字,我们宁可晚一点交付并说清原因。

可以,而且这是个合理的要求。您可以查阅规范及其版本历史、抽取样本独立打分,并把您的结果与我们报告的数值做比较。当客户并行跑自己的质检时,我们把双方结果的分歧视为一项值得调查的发现,而不是一场需要争论的纠纷。

质量

让我们在您自己的数据上把数字跑出来。

一个试点能产出真实的一致性数值、真实的错误拆解,以及对您的标签体系中哪些部分在规模化之后撑得住的如实判断。

在您提供任何数据之前先签保密协议。试点方案评估免费。