语音与对话

日语语音与音频数据标注

对日语音频做转写、时间戳标注、说话人分离、意图与槽位标注,以及情绪或方言标签——依据的是一份成文的约定,而不是没写下来的习惯。

把同一段日语音频交给两位转写员,如果没有约定,他们大概每三行就会有一行不一致。分歧不在于说了什么,而在于该怎么写下来。

转写稿是一组决策,而不是一份录音

日语没有词间空格,有四套书写系统,而且一个词怎么读和它按惯例怎么写之间差距很大。所以音频变成文字的那一刻,就已经有人做了几十个选择:有難うございます 是写成汉字还是假名,3人 该写作 3人 还是 三人,句首那个 えーっと 是保留还是删掉,说到一半重新起头是照实转写还是修正掉。

孤立地看,这些选择没有哪一个是错的。真正错的是在整个语料里做得前后不一致,因为用不一致的目标训练出的 ASR 模型会认为同一个音对应好几个字符串,而它的错误率就把这段差异吸收了进去。日语语音数据里最大的一根质量杠杆,就是一份写下来并且真的被执行的规范化约定。

所以每个语音项目我们都从敲定这份文档开始——如果您已经有了,我们采用您的,而不是把我们的强加过去。

要点速览

任务类型
逐字转写与整理稿转写、时间戳标注、说话人分离、意图与槽位标注、情绪与韵律、方言标签。
可处理音频
呼叫中心录音、会议、访谈、广播、车载与设备语音、自然对话。
约定
书写方式、语气词、数字、笑声与听不清片段,全部在转写开始前定义好。
常用输出
带词级或片段级时间戳的 JSON;也支持 SRT、VTT、CTM 与 TextGrid。
复核
每个文件都过第二遍听审,另在抽样上做盲评重新转写。

任务类型

我们标注什么

转写通常是基础层;其余各层都叠加在同一条时间轴上。

转写

逐字或整理稿两种,依据一份成文约定,涵盖语气词、重新起头、重复、发音错误与听不清的片段。

  • 保留不流畅现象的逐字稿
  • 便于阅读的整理稿
  • 听不清与重叠部分的标记
  • 非语音事件标签

时间与对齐

片段级、话轮级或词级的时间戳;已有转写稿时,可对其做强制对齐。

  • 话轮边界
  • 词级时间戳
  • 强制对齐质检
  • 静音与重叠区间

说话人标注

在语音重叠与声道切换中判断是谁在说话——这也是真实通话录音里最常出问题的一环。

  • 说话人分离与说话人 ID
  • 角色标签(坐席 / 客户)
  • 重叠处理
  • 说话人属性标注

意图与槽位标注

这句话想做什么、其中带有哪些取值,叠加在转写稿之上,供语音助手与通话分析类工作使用。

  • 意图分类
  • 槽位与实体区间
  • 对话行为标签
  • 通话结果与处理状态

副语言标注

情绪、情感倾向、韵律重音、说话风格与地域变体,依据既定类别打分,而不是凭印象。

  • 情绪与情感倾向
  • 说话风格与礼貌程度
  • 地域变体与口音
  • 音频质量与环境标签

日语特有问题

一份日语约定必须做出的决策

这四项,涵盖了两位称职转写员之间的大部分分歧。

同一个词的书写选择

ありがとう、有難う 与 アリガトウ 是同一个词。任由每位转写员自行决定,一份语料里三种都会出现,而模型会把它们当成不同的目标。

我们的处理方式 约定会列出常用词必须采用的写法,并为其余情况设定默认规则,交付前由自动检查标出不符的变体。

数字与量词

日语的量词会随所计名词改变读法——一本、一杯、一人——而一个数字可以写成 3、三 或 参。写得不一致,模型在数字上的准确率就无从度量。

我们的处理方式 一份数字规则按语境定死用阿拉伯数字还是汉字数字,以及量词与单位如何转写,并为日期、金额、时间与电话号码给出实例。

语气词与不流畅现象

あの、えーっと、まあ 与 そのー 在自然日语中随处可见。保留它们会让转写稿更嘈杂;删掉它们又会让逐字数据无法用于需要感知不流畅现象的模型。

我们的处理方式 逐字稿与整理稿两种版本分别定义,各自有固定的语气词清单与写法,因此这是一项项目级设置,而不是逐个文件临场判断。

礼貌与敬语形式

呼叫中心的日语里敬语与谦让语密集出现,其中好几组在转写员赶进度时常常听错——いたします 与 いただきます、よろしいでしょうか 与 よろしかったでしょうか。

我们的处理方式 复核员会针对您这类音频中特有的敬语用法接受说明,敬语错误在复核环节是一个具名类别,而不会被并进笼统的准确率里。

流程

一个语音项目是怎么跑的

约定文档在任何人转写完第一个完整文件之前就已写好,之后只能通过带版本的变更来修订。

  1. 01

    取样与界定范围

    我们会听一份有代表性的样本——包括您最差的那些音频,而不只是最干净的——并找出其中真正难的地方。

  2. 02

    撰写约定

    书写方式、数字、语气词、非语音事件、重叠、听不清片段、说话人角色与时间戳颗粒度,全部在一份经您确认的文档中定死。

  3. 03

    用试点做校准

    多位转写员各自独立处理同一批文件。凡是出现分歧的地方,说明约定有歧义,就把它写得更明确。

  4. 04

    转写与复核

    每个文件都由另一个人做第二遍听审;另取一份样本做盲评重新转写,据此得出实测的准确率数值。

  5. 05

    交付与报告

    转写稿、时间戳与标签随附约定版本号、质检报告,以及一份被标为无法使用、而不是靠猜填上的文件清单。

交付

输入与输出格式

我们直接使用您现有状态的音频。如果编解码格式或采样率限制了能做到的程度,我们会在项目开始前就说明,而不是事后才讲。

日语语音工作中常见的输入与输出格式。
层次默认输出也可提供
转写稿带片段时间戳的 JSON纯文本、SRT、VTT
词级时间戳JSONCTM、TextGrid
说话人标签RTTM 或 JSON 说话人话轮按声道拆分的转写稿
意图与槽位JSONL,每行一句话CSV、CoNLL 区间格式
副语言标签带时间区间的 JSONLCSV、ELAN 标注文件

质量

针对这类工作的专门控制手段

日语音频上的准确率是测出来的,不是说出来的——而且是在难处理的文件上测,不是在容易的那些上测。

  • 由第二位转写员对样本做盲评重新转写,得出每批次的实测错误率。
  • 交付前自动校验约定的执行情况:书写变体、数字格式与语气词写法。
  • 时间戳对照音频本身校验,而不只是与相邻片段比对。
  • 确实无法转写的文件会被标记并如实退回,绝不用一个看起来合理的猜测填上。
  • 说话人标签在整个文件范围内检查,以便发现中途身份互换的情况。
  • 质检样本中刻意纳入难处理的音频,让报告出来的数值反映整个语料,而不是其中最好的一部分。

常见问题

关于语音与音频

团队在寄出第一批日语音频之前会问的问题。

可以,而且对干净音频来说,这通常更划算。但要提醒一点:修正机器转写稿会让人倾向于接受屏幕上已有的内容,所以对训练数据,我们要么从零转写,要么在抽样上做一次盲评检查,测出修正这一遍到底抓出了多少问题。

我们会事先约定:方言是照说的样子转写,还是规范化成标准日语,因为这个决定会彻底改变数据集的性质。如果方言在范围内,我们会标注其变体;至于哪些变体我们能稳定安排到人、哪些不能,我们会如实相告。

我们处理的是真实录音,包括电话带宽的通话音频、背景噪声与说话人重叠。比格式更要紧的是:请您一开始就发来有代表性的样本——按干净音频界定范围、再拿嘈杂音频来交付,正是语音项目出问题的典型方式。

可以,在保密协议与数据处理协议之下,在带基于角色访问控制的隔离环境中进行,留存与删除条款写入合同。如果录音中含有个人信息,我们也可以把它标出来供脱敏,或者处理您在发送前已脱敏的音频。完整情况请见安全页面。

可以。重叠正是自动说话人分离最常失效的地方,也是把人放进这一环的主要理由之一。我们的约定规定了重叠语音如何切分与归属,因此处理方式是一致的,而不是逐个文件临时决定。

语音与音频

把您最难的音频发给我们,而不是最干净的那些。

一份有代表性的样本,能告诉我们的比一份规格说明多得多。我们会回复一份约定草案、一份转写好的样本,以及对预期错误率的如实判断。

在您提供任何数据之前先签保密协议。试点方案评估免费。