LLM 与生成式 AI

日语 LLM 训练数据——SFT、偏好与 RLHF

指令—回答数据对、排序比较、多轮对话与安全数据,由常驻日本的标注员依据一份经您团队确认的风格规范撰写。

日语指令数据真正难的地方不在于写出一个回答,而在于把同一个回答、用同一种语体,写上一万次——并且能白纸黑字地说清楚为什么选了这种语体。

日语指令数据是怎么跑偏的

由多人撰写的指令数据会发生漂移。一位标注员的每个回答都以 ですます 结尾,另一位在技术说明写到一半时切换成 である,第三位则用聊天助手那种简短语气。用这种混合数据训练出来的模型会认为三者都可以接受,然后随心所欲地输出其中任意一种——这正是我们听到的、关于日语微调最常见的抱怨。

会漂移的不只是语体,拒答的情况更糟。日语的拒绝是间接的,一个没有被告知拒答应该长什么样的标注员,写出来的可能是斩钉截铁的 お断りします,也可能是柔和的 それは難しいかもしれません。如果有一半安全数据的拒绝柔和到会被误认为是答应,模型学到的就是含糊其辞,而不是拒绝。

所以交付物从来不只是数据本身,还包括产生这些数据的成文决策:风格规范、拒答模板、格式规则,以及某一批数据当时所依据的各自版本号。

要点速览

数据集类型
指令 / SFT、偏好数据对与排序、多轮对话、安全与拒答数据、RAG 依据数据集。
撰写者
常驻日本的母语标注员,另有第二名标注员与一名资深复核员审核。
语体控制
一份成文的风格规范,在量产前先定死敬语层级、句尾形式、人称使用与排版格式。
常用格式
JSONL——SFT 用 messages 数组,偏好数据用 chosen / rejected 数据对。
数据溯源
每一条记录都带有其所依据的规范版本、撰写者角色与复核状态。

数据集类型

我们构建什么

五类数据集,通常组合使用。每一类对“正确”的定义都不同,因此各有自己的规范章节与自己的复核环节。

指令与 SFT 数据

用来示范目标行为的提示词—回答数据对,可以从零撰写,也可以在您现有内容的基础上改写。

  • 任务示范
  • 改写与摘要数据对
  • 领域问答
  • 带格式约束的输出

偏好与排序数据

依据成文标准对两个及以上候选回答进行比较,选择的理由是被记录下来的,而不是事后推测出来的。

  • 成对 chosen / rejected
  • N 路排序
  • 按维度打分
  • 每次比较附书面理由

多轮对话

语境会不断累积的对话——第一轮定下的语体必须一直撑到第八轮,而这正是大多数日语对话数据崩掉的地方。

  • 任务型对话
  • 澄清与纠错轮次
  • 上下文承接校验
  • 人设与角色一致性

安全、拒答与红队数据

应该被拒绝的提示词、看起来该拒绝但其实不该拒绝的提示词,以及区分二者的拒答措辞。

  • 按类别划分的拒答模板
  • 过度拒答的反例
  • 对抗性与越狱提示词
  • 日语中的敏感话题处理

RAG 与依据数据集

问题、检索到的段落与有依据的回答三元组,外加段落其实并不包含答案的负样本。

  • 可回答 / 不可回答数据对
  • 引用区间标注
  • 干扰段落
  • 日语文档依据标注

日语特有问题

为什么这件事是日语特有的

以下四项决策如果不做,产出的数据集在复核时看着没问题,用在模型上却表现很差。

敬语层级

日语在每一个句尾都强迫你做出敬语选择。ですます、である 与简体形并不能互换,而用混合数据训练出的模型会在同一个回答里把它们混着用。

我们的处理方式 风格规范为每一个产品界面定死一种默认语体,列出例外情况,并给出各自的实例。语体一致性是复核中的一项打分指标,而不是个人口味问题。

间接拒绝

それはちょっと難しいです 是一句拒绝,而不是在陈述难度。按字面标注它的标注员,等于在教模型把一次回绝读成一句中性的话。

我们的处理方式 拒答类别及其措辞会事先定义好,并标明各自预期的强度。安全数据会专门复核一项:这句拒绝在日语母语者读来是否确实像拒绝。

主语省略

日语会省略掉语境中不言自明的主语。在多轮数据里,被指代的对象可能出现在四轮之前,孤立地撰写某一轮回答的标注员就会猜错。

我们的处理方式 多轮条目按整段对话来撰写与复核,绝不逐轮处理。凡是指代确实存在歧义的,要么修改对话,要么整条弃用——绝不用一个猜测去标注它。

书写与格式变体

同一个词会写成汉字、平假名或片假名;数字与标点会出现全角或半角。放任不管,就是在教模型:格式是随机的。

我们的处理方式 一套规范化约定,涵盖常用词的书写选择、数字、标点、拉丁字母周围的空格与列表格式。它在撰写时即被执行,并在交付前自动校验。

流程

一个数据集是怎么建起来的

试点存在的意义,就是把规范的初稿打破。只有当它不再被打破时,量产才会开始。

  1. 01

    定义目标行为

    我们与您共同确定:对您的产品而言,一个好回答是什么样的——语体、长度、格式,什么该拒绝、怎么拒绝,以及模型不知道答案时应该怎么做。

  2. 02

    起草风格规范

    这些决策会变成一份带正例与反例的成文文档。您尚未拍板的模糊之处会在这里被摆到台面上,而不是被悄悄消化掉。

  3. 03

    试点与校准

    由多位标注员各自独立撰写一小批数据。凡是他们出现分歧的地方,说明规范讲得不清楚——我们改的是规范,不是标注员。

  4. 04

    量产撰写与复核

    每一条都由一名标注员撰写、另一名标注员复核,并由资深复核员抽检,以书面形式裁定分歧。

  5. 05

    打包与版本管理

    交付内容包括数据、规范版本号、逐条的溯源信息、质检报告,以及相对上一批的变更记录。

交付

您会拿到什么

字段在项目启动阶段商定;以下是您没有现成 schema 需要对接时的默认结构。

LLM 训练数据的默认交付结构。也支持自定义 schema。
数据集默认格式记录包含
指令 / SFTJSONL,messages 数组system / user / assistant 轮次、任务标签、规范版本号
偏好数据对JSONL,chosen + rejected两个候选、各维度分数、书面理由
多轮对话JSONL,每行一段对话完整轮次列表、人设说明、语体标签
安全与拒答JSONL提示词、类别、预期行为、实际使用的拒答措辞
RAG 依据数据JSONL问题、段落、答案、引用区间、是否可回答标记

质量

针对这类工作的专门控制手段

通用的标注质检抓不出语体漂移,也抓不出一句太软的拒绝。下面这些检查可以。

  • 语体一致性逐条打分,并覆盖一段对话中的每一轮。
  • 拒答强度由第二名母语者依据既定类别复核。
  • 交付前自动校验书写、数字、标点与空格的规范化情况。
  • 跨批次的重复与近似重复检测,避免数据集在不知不觉中丧失多样性。
  • 提示词多样性对照任务标签体系持续跟踪,避免某一类别被无意中过度采样。
  • 留出一份样本,由资深复核员盲评复核,据此得出该批次的质量数值。

常见问题

关于 LLM 训练数据

团队在规划第一次日语微调时会问的问题。

两者都可以。对日语来说,从零撰写很常见,因为可用的日语开源指令数据很稀缺,而机器翻译来的数据会把英语的句子结构带进模型。如果您已经有内容——客服记录、手册、内部文档——我们更多会在此基础上改写,这样数据才扎根在您真实的业务领域里。

靠一份带实例的成文风格规范、量产前的一轮校准(多位标注员各自独立撰写同一批条目),以及把语体一致性作为复核中一项明确的打分指标。一致性在这里是可以度量的属性,而不是一句愿望——我们盯的就是标注员之间的分歧,而每一处被裁定的分歧都会回写到规范中。

不会把它作为最终数据的来源。翻译而来的指令数据会继承英语的话语结构、英语的礼貌预设与英语的排版习惯,用它训练出的模型所产出的日语,母语读者一眼就会说这是翻译腔。我们确实会把翻译当作提示词构思的脚手架,但回答一律由日语母语者用日语撰写。

只有在您同意的前提下才可以,而且必须由人工在其之上改写与复核——绝不会未经复核就直接放行。是否使用了 AI 辅助会逐条记录下来,方便您日后筛选或审计。如果您要求数据完全由人类撰写,我们就按这种方式执行,溯源字段可以证明这一点。

比多数团队预想的要小。几千条精心撰写、语体一致的数据,对日语微调的推动,通常胜过十倍量的噪声数据,因为模型在学任务的同时也在学一种风格。我们会先做几百条规模的试点来验证规范,再根据试点测出的结果来确定量产规模。

LLM 训练数据

把您想教会模型的行为发给我们。

一段任务描述,加上几个示例回答,就足以开始。我们会回复我们需要您回答的标签体系问题,以及一份范围明确的试点方案。

在您提供任何数据之前先签保密协议。试点方案评估免费。