服务

覆盖各种模态的日语 AI 训练数据

五项服务,覆盖 AI 系统在各个阶段所需要的东西——从教会模型如何作答的指令数据,到告诉您它究竟有没有奏效的人工评测。

五项服务建立在同一套底座上:常驻日本的标注员、以版本管理而非凭记忆维护的标注规范,以及先度量、后声称的质量。

一支团队,覆盖数据的完整生命周期

大多数标注问题并不是打标签的问题,而是定义的问题:两个同样讲道理的人读同一份规范,却给同一句日语打上了不同的标签,而在模型把两者一起学进去之前,没有人会发现。把工作拆成五项服务,正是为了让这些定义显性化——每项服务都有自己的标签体系问题、自己的失效方式,以及自己的质检环节。

这五项服务不是让您二选一的套餐。一个项目通常会同时用到其中三项:用 NLP 标注建立带标签的语料,用 LLM 训练数据把它转成指令与偏好数据对,再用评测来度量最终的模型到底做了什么。贯穿始终不变的,是底层那份对日语的判断力。

要点速览

模态
日语的文本、语音、图像、视频、文档与多模态数据。
模型阶段
语料筛选、有监督微调、偏好与 RLHF 数据、评测与基准测试。
交付格式
JSONL、CSV、CoNLL-U、SRT、CTM、COCO——或您自定义的 schema。
工具
我们可以在您的标注平台内作业,也可以在我们自有的安全环境中完成。
起点
一个范围明确的试点。在放量之前先验证标签体系与质量。

如何选择

我需要哪项服务?

从您想改变模型的哪一点出发。服务是由这个目标推导出来的,而不是由您手头恰好有什么文件类型决定的。

把目标对应到服务。多数项目最终会组合其中两到三项。
如果您的目标是……对应服务典型的首个交付物
让模型用自然且语体正确的日语作答LLM 训练数据一批试点规模的指令—回答数据对,附已定稿的风格规范
在上线之前找出模型错在哪里LLM 评测一套已打分的评测集,附评分量表与标注者间一致性数据
让模型准确听懂日语语音语音与音频带成文规范化约定的转写音频
读懂日语的文档、表单或屏幕上的文字图像与视频在有代表性的文档样本上完成的 OCR 与版面标注
从日语文本中抽取结构化事实文本与 NLP一套经真实边界案例检验的实体与关系 schema
让专业人士评判受监管领域中的回答专家标注一套经专家复核的评测集,附书面裁定记录

生命周期

各项服务的定位

同一份数据集很少能同时服务于两个阶段。用来教模型的数据,拿来测它就很不合格,因为模型早就见过它了。

  1. 01

    语料准备

    对原始日语文本、语音或文档做筛选、去重规则设定,以及质量与安全标记。它决定了究竟哪些内容值得拿去标注。

  2. 02

    有监督微调

    指令—回答数据对、多轮对话与任务示范,全部用产品实际使用的语体来撰写。

  3. 03

    偏好与对齐

    排序或成对比较、安全与拒答行为,以及说明为什么一个回答优于另一个的成文标准。

  4. 04

    评测

    由未参与训练数据构建的人员完成留出集与量表打分,从而保证度量是独立的。

  5. 05

    生产监控

    对线上模型输出做抽样,用同一套量表打分,并把反复出现的失效回流到下一轮数据迭代。

交付

格式与交付

每一批交付都附带标注时所依据的标签体系版本号,以及相对上一批的变更记录,让各版本数据集始终可以相互比较。

常用交付格式。自定义 schema 在项目启动阶段定义,并与数据一同做版本管理。
数据类型常用交付格式也可提供
文本与 NLPJSONLCSV、CoNLL-U、brat standoff、Parquet
LLM 指令与偏好数据JSONL(messages / chosen–rejected)CSV、Hugging Face 数据集结构
语音带时间戳的 JSONSRT、VTT、CTM、TextGrid、纯文本转写稿
图像与视频COCO JSONYOLO、Pascal VOC、CVAT XML、逐帧 JSONL
文档与 OCR带页面几何信息的 JSONhOCR、ALTO、CSV 字段抽取结果
评测结果JSONL 打分结果,附质检报告CSV、评分 notebook、裁定记录

常见问题

关于这些服务

在确定试点范围之前,常被问到的范围与流程类问题。

可以,而且多数项目都是这样。典型的顺序是:先用 NLP 标注建立带标签的语料,再据此构建 LLM 训练数据,然后由另一组标注员来做评测。把它们放在同一个合作项目下推进,意味着标签体系、风格规范与质检指标能够保持一致,而不必在每个供应商那里重新推导一遍。

日语是我们从一开始就为之而建的,日英双语的工作也包含在其中。至于其他语言的大批量工作,与其接下项目再转包出去,我们更愿意直接告诉您:我们不是合适的供应商。

按工作量计价——按条、按音频小时、按张图或按次评测——具体取决于任务复杂度、每条需要多少复核工时,以及所需的专业层级。我们会在用您的真实数据做完试点范围界定之后再报价,因为仅凭一段任务描述给出的报价只是猜测,而且通常是错的。

由我们起草、您评审,两件事都发生在量产之前。试点的意义就在于用真实的边界案例把初稿打破;试点期间裁定的每一处分歧,都会回写到该文档中。规范随后进入版本管理,每一批交付都会记录它是依据哪个版本标注的。

从这里开始

告诉我们,模型需要学会什么。

把任务、一份数据样本,以及您所面临的各项约束发给我们。我们会回复一份范围明确的试点方案、我们需要您回答的标签体系问题,以及对其中难点的如实判断。

在您提供任何数据之前先签保密协议。试点方案评估免费。