规范缺口
规范没有覆盖到这个情形。修的办法是改规范,而不是改这一条——否则同样的情形还会再出现。
质量体系
质量要么是一个您能据以行动的数字,要么就只是一种意见。本页说明我们究竟产出哪些数字、它们是怎么算出来的、它们能告诉您什么、不能告诉您什么,以及每批数据的质检报告里会有什么。
本站上作为示例展示的每一个数字,都明确标明是示例。我们不公布准确率保证,因为在没看到您的数据之前给出的保证不是承诺——那是一个营销数字。
最后一道检查能抓出错误,却抓不出歧义,而真正让日语数据集劣化的正是歧义。如果规范允许对某个情形有两种读法,那么两种读法都能通过检查,这份不一致就会带着一张健康证明进入训练数据。
所以决定质量的工作发生在标注之前:撰写规范、在试点中用真实的边界案例把它打破、度量独立标注的人是否收敛,并在他们不收敛的地方修改规范。复核是第二道防线,不是第一道。
以下是整套体系,包括那些公布出来并不好看的部分——每个指标抓不到什么,以及在哪些情况下数字看着健康、数据集其实并不健康。
要点速览
体系
这个闭环贯穿整个项目周期,而不是开头跑一次就完了。
规范会为任务所需的每一个决定写上正例与反例。凡是在这里被留成隐含的,之后都会变成不一致。
标注员各自独立标注同一份校准集。分歧指明了规范在哪里有歧义——要改的是规范,不是标注员。
量产作业,逐条记录所依据的规范版本,这样日后对某条记录有疑问时能准确回答。
由第二名标注员按任务所需的深度复核。复核是一个有自身指标的独立角色,而不是把标注再快速做一遍。
分歧交由资深复核员处理,记录裁定结果与理由。每一次裁定都会成为规范中的一个实例。
一致性、金标准集准确率与漂移按批次计算,与之前的批次比较,用来判断下一版规范该改哪里。
指标
在这里定义清楚,是为了让质检报告里的一个数值无需再问我们它指的是什么。
一致性
97.8%
2.1% 较过去 7 天
金标准集准确率
98.6%
1.4% 较过去 7 天
已复核条目
24826
18.7% 本周
待裁定分歧
18
12 较过去 7 天
界面示意。图中数字为示例数据,仅用于说明我们如何监控质量,并非已取得的实际结果。
复核
复核深度是一项项目级设置,与您商定并写入合同。并非越重越好——一个机械性任务按最高深度复核,等于把预算花在了不需要判断的地方。
| 复核深度 | 通常用于 | 具体做法 |
|---|---|---|
| 抽样复核 | 一致性稳定的大批量机械性任务 | 按既定比例抽取条目复核;出现不合格则触发更大范围的复核 |
| 全量二次复核 | 依赖判断的标注,以及大多数日语区间类工作 | 每一条都由第二名标注员复核 |
| 盲评双标注 | 评测集、基准测试集与金标准集 | 两位标注员独立作业;所有分歧全部裁定 |
| 专家复核 | 受监管领域与需要专业判断的场景 | 由领域专家复核,对有争议的条目附书面理由 |
错误分类体系
一种有名字的缺陷才能被计数、看趋势、被修掉。一个笼统的“错误”总数,没法告诉您该改什么。
规范没有覆盖到这个情形。修的办法是改规范,而不是改这一条——否则同样的情形还会再出现。
情形已被覆盖,但标注员把规则用错了。通过反馈来修正;如果反复出现,就补一个更清楚的实例。
标签对了,区间不对。这是日语区间类工作特有的问题,边界规则与分词方式在这里相互作用。
语言上正确,社交上错误:礼貌层级用错,或者拒绝柔和到读不出是在拒绝。
某个可核实的说法、名字读法或数字是错的。它与判断类错误分开,因为修它靠的是核实,而不是校准。
条目本身无法使用——听不清的音频、看不清的扫描件、有歧义的提示词。会被标记并如实退回,绝不用一个看起来合理的猜测填上。
报告
这份报告的设计目标是:即使我们不在场,您也能自行审计这一批数据。
常见问题
关于这些数字能证明什么、不能证明什么的问题。
我们不公布准确率保证,而且对任何供应商给出的这类保证,我们都会持谨慎态度。可达到的准确率取决于任务、标签体系、源数据质量,以及这个领域本身含有多少真正的歧义——在试点之前,这些都是未知数。我们承诺的是度量方法:用哪些指标、怎么计算、以什么频率报告,以及某一批不达标时会怎么处理。在您的数据上做完试点之后,我们就可以谈实际可行的目标了,因为到那时才有真东西可谈。
它们是示例数据。它们的作用是展示界面会报告什么、这些指标动起来是什么样子,也正因如此,它们旁边有醒目的标记与免责说明。它们不是来自客户项目的结果,我们也不会把它们当作结果来呈现。
单凭这一点并不能。一致性度量的是一致,不是正确——共享同一个误解的标注员会完全一致。它也会被分布不均衡的标签体系抬高,所以我们会在原始一致率之外报告一个经机遇校正的系数,也正因如此,才需要由资深复核员裁定的金标准集来独立检验正确性。
它不会交付。视失效原因,处理方式可能是针对性重标注、先改规范再返工受影响的条目,或者在原因出在上游时上报给您——比如标签体系有歧义,或者源数据支撑不了这个任务。与其准时交付一个撑不过与您模型对接的数字,我们宁可晚一点交付并说清原因。
可以,而且这是个合理的要求。您可以查阅规范及其版本历史、抽取样本独立打分,并把您的结果与我们报告的数值做比较。当客户并行跑自己的质检时,我们把双方结果的分歧视为一项值得调查的发现,而不是一场需要争论的纠纷。