转写
逐字或整理稿两种,依据一份成文约定,涵盖语气词、重新起头、重复、发音错误与听不清的片段。
- 保留不流畅现象的逐字稿
- 便于阅读的整理稿
- 听不清与重叠部分的标记
- 非语音事件标签
语音与对话
对日语音频做转写、时间戳标注、说话人分离、意图与槽位标注,以及情绪或方言标签——依据的是一份成文的约定,而不是没写下来的习惯。
把同一段日语音频交给两位转写员,如果没有约定,他们大概每三行就会有一行不一致。分歧不在于说了什么,而在于该怎么写下来。
日语没有词间空格,有四套书写系统,而且一个词怎么读和它按惯例怎么写之间差距很大。所以音频变成文字的那一刻,就已经有人做了几十个选择:有難うございます 是写成汉字还是假名,3人 该写作 3人 还是 三人,句首那个 えーっと 是保留还是删掉,说到一半重新起头是照实转写还是修正掉。
孤立地看,这些选择没有哪一个是错的。真正错的是在整个语料里做得前后不一致,因为用不一致的目标训练出的 ASR 模型会认为同一个音对应好几个字符串,而它的错误率就把这段差异吸收了进去。日语语音数据里最大的一根质量杠杆,就是一份写下来并且真的被执行的规范化约定。
所以每个语音项目我们都从敲定这份文档开始——如果您已经有了,我们采用您的,而不是把我们的强加过去。
要点速览
任务类型
转写通常是基础层;其余各层都叠加在同一条时间轴上。
逐字或整理稿两种,依据一份成文约定,涵盖语气词、重新起头、重复、发音错误与听不清的片段。
片段级、话轮级或词级的时间戳;已有转写稿时,可对其做强制对齐。
在语音重叠与声道切换中判断是谁在说话——这也是真实通话录音里最常出问题的一环。
这句话想做什么、其中带有哪些取值,叠加在转写稿之上,供语音助手与通话分析类工作使用。
情绪、情感倾向、韵律重音、说话风格与地域变体,依据既定类别打分,而不是凭印象。
日语特有问题
这四项,涵盖了两位称职转写员之间的大部分分歧。
ありがとう、有難う 与 アリガトウ 是同一个词。任由每位转写员自行决定,一份语料里三种都会出现,而模型会把它们当成不同的目标。
我们的处理方式 约定会列出常用词必须采用的写法,并为其余情况设定默认规则,交付前由自动检查标出不符的变体。
日语的量词会随所计名词改变读法——一本、一杯、一人——而一个数字可以写成 3、三 或 参。写得不一致,模型在数字上的准确率就无从度量。
我们的处理方式 一份数字规则按语境定死用阿拉伯数字还是汉字数字,以及量词与单位如何转写,并为日期、金额、时间与电话号码给出实例。
あの、えーっと、まあ 与 そのー 在自然日语中随处可见。保留它们会让转写稿更嘈杂;删掉它们又会让逐字数据无法用于需要感知不流畅现象的模型。
我们的处理方式 逐字稿与整理稿两种版本分别定义,各自有固定的语气词清单与写法,因此这是一项项目级设置,而不是逐个文件临场判断。
呼叫中心的日语里敬语与谦让语密集出现,其中好几组在转写员赶进度时常常听错——いたします 与 いただきます、よろしいでしょうか 与 よろしかったでしょうか。
我们的处理方式 复核员会针对您这类音频中特有的敬语用法接受说明,敬语错误在复核环节是一个具名类别,而不会被并进笼统的准确率里。
流程
约定文档在任何人转写完第一个完整文件之前就已写好,之后只能通过带版本的变更来修订。
我们会听一份有代表性的样本——包括您最差的那些音频,而不只是最干净的——并找出其中真正难的地方。
书写方式、数字、语气词、非语音事件、重叠、听不清片段、说话人角色与时间戳颗粒度,全部在一份经您确认的文档中定死。
多位转写员各自独立处理同一批文件。凡是出现分歧的地方,说明约定有歧义,就把它写得更明确。
每个文件都由另一个人做第二遍听审;另取一份样本做盲评重新转写,据此得出实测的准确率数值。
转写稿、时间戳与标签随附约定版本号、质检报告,以及一份被标为无法使用、而不是靠猜填上的文件清单。
交付
我们直接使用您现有状态的音频。如果编解码格式或采样率限制了能做到的程度,我们会在项目开始前就说明,而不是事后才讲。
| 层次 | 默认输出 | 也可提供 |
|---|---|---|
| 转写稿 | 带片段时间戳的 JSON | 纯文本、SRT、VTT |
| 词级时间戳 | JSON | CTM、TextGrid |
| 说话人标签 | RTTM 或 JSON 说话人话轮 | 按声道拆分的转写稿 |
| 意图与槽位 | JSONL,每行一句话 | CSV、CoNLL 区间格式 |
| 副语言标签 | 带时间区间的 JSONL | CSV、ELAN 标注文件 |
质量
日语音频上的准确率是测出来的,不是说出来的——而且是在难处理的文件上测,不是在容易的那些上测。
常见问题
团队在寄出第一批日语音频之前会问的问题。
可以,而且对干净音频来说,这通常更划算。但要提醒一点:修正机器转写稿会让人倾向于接受屏幕上已有的内容,所以对训练数据,我们要么从零转写,要么在抽样上做一次盲评检查,测出修正这一遍到底抓出了多少问题。
我们会事先约定:方言是照说的样子转写,还是规范化成标准日语,因为这个决定会彻底改变数据集的性质。如果方言在范围内,我们会标注其变体;至于哪些变体我们能稳定安排到人、哪些不能,我们会如实相告。
我们处理的是真实录音,包括电话带宽的通话音频、背景噪声与说话人重叠。比格式更要紧的是:请您一开始就发来有代表性的样本——按干净音频界定范围、再拿嘈杂音频来交付,正是语音项目出问题的典型方式。
可以,在保密协议与数据处理协议之下,在带基于角色访问控制的隔离环境中进行,留存与删除条款写入合同。如果录音中含有个人信息,我们也可以把它标出来供脱敏,或者处理您在发送前已脱敏的音频。完整情况请见安全页面。
可以。重叠正是自动说话人分离最常失效的地方,也是把人放进这一环的主要理由之一。我们的约定规定了重叠语音如何切分与归属,因此处理方式是一致的,而不是逐个文件临时决定。