指令与 SFT 数据
用来示范目标行为的提示词—回答数据对,可以从零撰写,也可以在您现有内容的基础上改写。
- 任务示范
- 改写与摘要数据对
- 领域问答
- 带格式约束的输出
LLM 与生成式 AI
指令—回答数据对、排序比较、多轮对话与安全数据,由常驻日本的标注员依据一份经您团队确认的风格规范撰写。
日语指令数据真正难的地方不在于写出一个回答,而在于把同一个回答、用同一种语体,写上一万次——并且能白纸黑字地说清楚为什么选了这种语体。
由多人撰写的指令数据会发生漂移。一位标注员的每个回答都以 ですます 结尾,另一位在技术说明写到一半时切换成 である,第三位则用聊天助手那种简短语气。用这种混合数据训练出来的模型会认为三者都可以接受,然后随心所欲地输出其中任意一种——这正是我们听到的、关于日语微调最常见的抱怨。
会漂移的不只是语体,拒答的情况更糟。日语的拒绝是间接的,一个没有被告知拒答应该长什么样的标注员,写出来的可能是斩钉截铁的 お断りします,也可能是柔和的 それは難しいかもしれません。如果有一半安全数据的拒绝柔和到会被误认为是答应,模型学到的就是含糊其辞,而不是拒绝。
所以交付物从来不只是数据本身,还包括产生这些数据的成文决策:风格规范、拒答模板、格式规则,以及某一批数据当时所依据的各自版本号。
要点速览
数据集类型
五类数据集,通常组合使用。每一类对“正确”的定义都不同,因此各有自己的规范章节与自己的复核环节。
用来示范目标行为的提示词—回答数据对,可以从零撰写,也可以在您现有内容的基础上改写。
依据成文标准对两个及以上候选回答进行比较,选择的理由是被记录下来的,而不是事后推测出来的。
语境会不断累积的对话——第一轮定下的语体必须一直撑到第八轮,而这正是大多数日语对话数据崩掉的地方。
应该被拒绝的提示词、看起来该拒绝但其实不该拒绝的提示词,以及区分二者的拒答措辞。
问题、检索到的段落与有依据的回答三元组,外加段落其实并不包含答案的负样本。
日语特有问题
以下四项决策如果不做,产出的数据集在复核时看着没问题,用在模型上却表现很差。
日语在每一个句尾都强迫你做出敬语选择。ですます、である 与简体形并不能互换,而用混合数据训练出的模型会在同一个回答里把它们混着用。
我们的处理方式 风格规范为每一个产品界面定死一种默认语体,列出例外情况,并给出各自的实例。语体一致性是复核中的一项打分指标,而不是个人口味问题。
それはちょっと難しいです 是一句拒绝,而不是在陈述难度。按字面标注它的标注员,等于在教模型把一次回绝读成一句中性的话。
我们的处理方式 拒答类别及其措辞会事先定义好,并标明各自预期的强度。安全数据会专门复核一项:这句拒绝在日语母语者读来是否确实像拒绝。
日语会省略掉语境中不言自明的主语。在多轮数据里,被指代的对象可能出现在四轮之前,孤立地撰写某一轮回答的标注员就会猜错。
我们的处理方式 多轮条目按整段对话来撰写与复核,绝不逐轮处理。凡是指代确实存在歧义的,要么修改对话,要么整条弃用——绝不用一个猜测去标注它。
同一个词会写成汉字、平假名或片假名;数字与标点会出现全角或半角。放任不管,就是在教模型:格式是随机的。
我们的处理方式 一套规范化约定,涵盖常用词的书写选择、数字、标点、拉丁字母周围的空格与列表格式。它在撰写时即被执行,并在交付前自动校验。
流程
试点存在的意义,就是把规范的初稿打破。只有当它不再被打破时,量产才会开始。
我们与您共同确定:对您的产品而言,一个好回答是什么样的——语体、长度、格式,什么该拒绝、怎么拒绝,以及模型不知道答案时应该怎么做。
这些决策会变成一份带正例与反例的成文文档。您尚未拍板的模糊之处会在这里被摆到台面上,而不是被悄悄消化掉。
由多位标注员各自独立撰写一小批数据。凡是他们出现分歧的地方,说明规范讲得不清楚——我们改的是规范,不是标注员。
每一条都由一名标注员撰写、另一名标注员复核,并由资深复核员抽检,以书面形式裁定分歧。
交付内容包括数据、规范版本号、逐条的溯源信息、质检报告,以及相对上一批的变更记录。
交付
字段在项目启动阶段商定;以下是您没有现成 schema 需要对接时的默认结构。
| 数据集 | 默认格式 | 记录包含 |
|---|---|---|
| 指令 / SFT | JSONL,messages 数组 | system / user / assistant 轮次、任务标签、规范版本号 |
| 偏好数据对 | JSONL,chosen + rejected | 两个候选、各维度分数、书面理由 |
| 多轮对话 | JSONL,每行一段对话 | 完整轮次列表、人设说明、语体标签 |
| 安全与拒答 | JSONL | 提示词、类别、预期行为、实际使用的拒答措辞 |
| RAG 依据数据 | JSONL | 问题、段落、答案、引用区间、是否可回答标记 |
质量
通用的标注质检抓不出语体漂移,也抓不出一句太软的拒绝。下面这些检查可以。
常见问题
团队在规划第一次日语微调时会问的问题。
两者都可以。对日语来说,从零撰写很常见,因为可用的日语开源指令数据很稀缺,而机器翻译来的数据会把英语的句子结构带进模型。如果您已经有内容——客服记录、手册、内部文档——我们更多会在此基础上改写,这样数据才扎根在您真实的业务领域里。
靠一份带实例的成文风格规范、量产前的一轮校准(多位标注员各自独立撰写同一批条目),以及把语体一致性作为复核中一项明确的打分指标。一致性在这里是可以度量的属性,而不是一句愿望——我们盯的就是标注员之间的分歧,而每一处被裁定的分歧都会回写到规范中。
不会把它作为最终数据的来源。翻译而来的指令数据会继承英语的话语结构、英语的礼貌预设与英语的排版习惯,用它训练出的模型所产出的日语,母语读者一眼就会说这是翻译腔。我们确实会把翻译当作提示词构思的脚手架,但回答一律由日语母语者用日语撰写。
只有在您同意的前提下才可以,而且必须由人工在其之上改写与复核——绝不会未经复核就直接放行。是否使用了 AI 辅助会逐条记录下来,方便您日后筛选或审计。如果您要求数据完全由人类撰写,我们就按这种方式执行,溯源字段可以证明这一点。
比多数团队预想的要小。几千条精心撰写、语体一致的数据,对日语微调的推动,通常胜过十倍量的噪声数据,因为模型在学任务的同时也在学一种风格。我们会先做几百条规模的试点来验证规范,再根据试点测出的结果来确定量产规模。