服务
覆盖各种模态的日语 AI 训练数据
五项服务,覆盖 AI 系统在各个阶段所需要的东西——从教会模型如何作答的指令数据,到告诉您它究竟有没有奏效的人工评测。
五项服务建立在同一套底座上:常驻日本的标注员、以版本管理而非凭记忆维护的标注规范,以及先度量、后声称的质量。
一支团队,覆盖数据的完整生命周期
大多数标注问题并不是打标签的问题,而是定义的问题:两个同样讲道理的人读同一份规范,却给同一句日语打上了不同的标签,而在模型把两者一起学进去之前,没有人会发现。把工作拆成五项服务,正是为了让这些定义显性化——每项服务都有自己的标签体系问题、自己的失效方式,以及自己的质检环节。
这五项服务不是让您二选一的套餐。一个项目通常会同时用到其中三项:用 NLP 标注建立带标签的语料,用 LLM 训练数据把它转成指令与偏好数据对,再用评测来度量最终的模型到底做了什么。贯穿始终不变的,是底层那份对日语的判断力。
要点速览
- 模态
- 日语的文本、语音、图像、视频、文档与多模态数据。
- 模型阶段
- 语料筛选、有监督微调、偏好与 RLHF 数据、评测与基准测试。
- 交付格式
- JSONL、CSV、CoNLL-U、SRT、CTM、COCO——或您自定义的 schema。
- 工具
- 我们可以在您的标注平台内作业,也可以在我们自有的安全环境中完成。
- 起点
- 一个范围明确的试点。在放量之前先验证标签体系与质量。
我们做什么
五项服务,外加专家层
每项服务都有独立页面,写明其中的标签体系决策、日语特有的陷阱与具体交付物。
LLM 训练数据
用日语撰写的指令、偏好与 RLHF 数据集,其中的语体决策都被明确写了下来。
- 指令与 SFT 数据
- 偏好与排序数据
- 多轮对话
- 安全、拒答与红队数据
LLM 评测
对日语模型输出的人工评测——评分量表、成对偏好比较、事实性核查与红队测试。
- 成对偏好比较
- 量表打分
- 事实性与依据核查
- 安全与红队测试
语音与音频
日语 ASR 转写、说话人分离与意图标注,规范化约定全部写在纸面上。
- 转写
- 时间与对齐
- 说话人标注
- 意图与槽位标注
图像与视频
面向日语图像、视频与纸质单据的边界框、分割、OCR 与文档版面标注。
- 检测与分割
- 关键点与属性
- 视频标注
- OCR 与文档版面
文本与 NLP
日语文本上的实体、关系、意图与情感标注,分词边界是决定出来的,而不是想当然的。
- 命名实体识别
- 关系与事件抽取
- 分类
- 情感与情绪
专家标注
由日本领域专家参与的标注与评测,面向在受监管领域中运行的 AI。
- 律师
- 税务师
- 注册会计师
- 社会保险劳务士
如何选择
我需要哪项服务?
从您想改变模型的哪一点出发。服务是由这个目标推导出来的,而不是由您手头恰好有什么文件类型决定的。
| 如果您的目标是…… | 对应服务 | 典型的首个交付物 |
|---|---|---|
| 让模型用自然且语体正确的日语作答 | LLM 训练数据 | 一批试点规模的指令—回答数据对,附已定稿的风格规范 |
| 在上线之前找出模型错在哪里 | LLM 评测 | 一套已打分的评测集,附评分量表与标注者间一致性数据 |
| 让模型准确听懂日语语音 | 语音与音频 | 带成文规范化约定的转写音频 |
| 读懂日语的文档、表单或屏幕上的文字 | 图像与视频 | 在有代表性的文档样本上完成的 OCR 与版面标注 |
| 从日语文本中抽取结构化事实 | 文本与 NLP | 一套经真实边界案例检验的实体与关系 schema |
| 让专业人士评判受监管领域中的回答 | 专家标注 | 一套经专家复核的评测集,附书面裁定记录 |
生命周期
各项服务的定位
同一份数据集很少能同时服务于两个阶段。用来教模型的数据,拿来测它就很不合格,因为模型早就见过它了。
-
01
语料准备
对原始日语文本、语音或文档做筛选、去重规则设定,以及质量与安全标记。它决定了究竟哪些内容值得拿去标注。
-
02
有监督微调
指令—回答数据对、多轮对话与任务示范,全部用产品实际使用的语体来撰写。
-
03
偏好与对齐
排序或成对比较、安全与拒答行为,以及说明为什么一个回答优于另一个的成文标准。
-
04
评测
由未参与训练数据构建的人员完成留出集与量表打分,从而保证度量是独立的。
-
05
生产监控
对线上模型输出做抽样,用同一套量表打分,并把反复出现的失效回流到下一轮数据迭代。
交付
格式与交付
每一批交付都附带标注时所依据的标签体系版本号,以及相对上一批的变更记录,让各版本数据集始终可以相互比较。
| 数据类型 | 常用交付格式 | 也可提供 |
|---|---|---|
| 文本与 NLP | JSONL | CSV、CoNLL-U、brat standoff、Parquet |
| LLM 指令与偏好数据 | JSONL(messages / chosen–rejected) | CSV、Hugging Face 数据集结构 |
| 语音 | 带时间戳的 JSON | SRT、VTT、CTM、TextGrid、纯文本转写稿 |
| 图像与视频 | COCO JSON | YOLO、Pascal VOC、CVAT XML、逐帧 JSONL |
| 文档与 OCR | 带页面几何信息的 JSON | hOCR、ALTO、CSV 字段抽取结果 |
| 评测结果 | JSONL 打分结果,附质检报告 | CSV、评分 notebook、裁定记录 |
常见问题
关于这些服务
在确定试点范围之前,常被问到的范围与流程类问题。
可以,而且多数项目都是这样。典型的顺序是:先用 NLP 标注建立带标签的语料,再据此构建 LLM 训练数据,然后由另一组标注员来做评测。把它们放在同一个合作项目下推进,意味着标签体系、风格规范与质检指标能够保持一致,而不必在每个供应商那里重新推导一遍。
日语是我们从一开始就为之而建的,日英双语的工作也包含在其中。至于其他语言的大批量工作,与其接下项目再转包出去,我们更愿意直接告诉您:我们不是合适的供应商。
按工作量计价——按条、按音频小时、按张图或按次评测——具体取决于任务复杂度、每条需要多少复核工时,以及所需的专业层级。我们会在用您的真实数据做完试点范围界定之后再报价,因为仅凭一段任务描述给出的报价只是猜测,而且通常是错的。
由我们起草、您评审,两件事都发生在量产之前。试点的意义就在于用真实的边界案例把初稿打破;试点期间裁定的每一处分歧,都会回写到该文档中。规范随后进入版本管理,每一批交付都会记录它是依据哪个版本标注的。