音频转文字示例展示的是口语如何呈现为书面记录:左侧是时间戳,每次发言单独成段,说话人变化时标注身份。 两种常见形式是去除口头语的整理逐字稿,以及保留每个“嗯”和中断句的完整逐字稿。
这些基本概念,各类指南的解释大同小异。但很少有指南让您直接听到示例对应的原始录音。
这一点比想象中更重要。录音棚里清晰录制的一段独白,与四个人围着桌子、共用桌中央一个麦克风的讨论,转写结果会很不一样。也许只有其中一种接近您的实际文件。因此,我们选取了三段真实录音:会议、访谈和语音留言。每段都附有系统生成的转写文本,并随播放逐词高亮。没有重新录入,也没有人工修正。
会议样本所属的语料库还提供了人工参考转写,因此本文最后会将系统结果与之对照,给出具体错误率。录音及对应转写保留英文原文,便于逐句核对;它们不是未翻译的界面内容。
示例 1:三人会议,麦克风离说话人较远
点击播放。高亮会跟随当前说出的单词,说话人变化时标签也随之变化。
我们特意选择了一个较难的场景。麦克风不是夹在某个人衣领上,而是放在桌子中央,远距离收录所有人的声音,同时也收进房间里的回声。三个人交谈,时而互相打断。
请留意以下现象,它们能说明真实会议转写会出现什么问题:
最后一点是自动转写在远距离录音中的真实局限。下文的准确性分析会给出具体数量。
示例 2:麦克风靠近说话人的访谈
使用的是同一套系统,阅读体验却完全不同。每次只有一个人发言,麦克风距离较近,也没有声音重叠。句子完整,标点与停顿相符,不需要费力辨别交叠的发言。
与上一段会议对比,最有用的结论是:录音条件决定转写质量。 领夹麦克风或耳麦带来的改善,往往比调整软件参数更明显。
示例 3:一位说话人,十六秒的语音留言
单人短录音是相对简单的情况,也展示了最基础的转写形式:只有一个声音,不需要反复标注说话人;时间戳出现在每组句子的开头。
日常的语音备忘录、课堂录音或口述笔记,通常就是这样呈现的:一列时间,一列文字。
整理逐字稿与完整逐字稿
两种形式对应同一段录音,区别在于删去了什么。
完整逐字稿保留说话人的全部表达,包括本人未必希望被引用的部分。以下示例保留录音中的英文:
```
0:08 I had to figure out how to how to do the same thing for the
summary, that's how I see it.
```
“how to how to”的重复不是转写错误,而是说话人确实重复了这些词。
整理逐字稿会去掉重复、口头语和未说完的起句,不改变其余意思:
```
0:08 I had to figure out how to do the same thing for the summary.
```
选择哪一种,取决于文本的用途:
| 用途 | 形式 | 原因 || --- | --- | --- || 定性研究、法律和医疗场景 | 完整逐字稿 | 犹豫和重复也可能是重要信息 || 会议笔记、内部记录 | 整理逐字稿 | 口语中的磕绊通常无助于阅读 || 发布、字幕和营销 | 整理逐字稿,再进行校对 | 优先保证可读性 || 语言与语音研究 | 完整逐字稿,加上非语言标记 | 包括 `[停顿]`、`[笑声]`、`[听不清]` |实用做法是先保留完整逐字稿,再整理一份副本。从完整版本整理出精简版本通常只需几分钟;反过来补回被删掉的细节,就得重新听录音。
多人转写的格式
不止一人发言时,转写需要说明是谁在说话。通常每次发言单独成段,将说话人标签放在左侧或上方。下例保留英文原话:
```
Speaker 1 So did you have to write it in the way that they wrote it,
is that what you did?
Speaker 2 Yeah, just search for specific string.
Speaker 1 Fish the data, I was just thinking that, yeah.
```
会议示例体现了三条实用规则:
1. 不要把两个人的发言合在同一段。 一段里混入两个声音,会增加引用、研究编码和查找的难度。
2. 换人时标注,不必每行都标。 连续六行都写“说话人 1”,反而干扰阅读。
3. 最后统一替换姓名。 自动系统使用 `Speaker 1`、`Speaker 2` 等通用标签。校对完文字后,再替换为真实姓名即可。
视频转写是什么样的
视频转写依据的是音轨,画面内容不会自动补充到转写文本中。主要区别在于时间戳的后续用途:
同一份录音可以生成两种结果。导出 SRT 是格式转换,而不是重新转写。如果需要字幕,先完成转写,再调整字幕块的切分与时长。
很少被公开的准确性数据
许多示例页面到了准确性问题上就不够具体。原文调查时,SpeakWrite 宣称“99%–100% 准确率”,TranscribeMe 宣称“99%+”,但所引用的页面没有同时提供对应音频和评测用参考转写。缺少这些材料,就无法独立核验或直接比较这些百分比。
上面的会议样本可以核对,因为 AMI 语料库提供了人工参考文本。下面是 48 秒片段的对照:
| | 人工参考文本 | 系统转写 || --- | --- | --- || 词数 | 208 | 163 || 发言次数/片段数 | 20 | 10 || 说话人数 | 3 | 2 || “okay”“right”“mm-hmm”等简短回应 | 7 | 2 |该片段的词错误率为 30.8%:41 处替换、17 处遗漏和 6 处插入。
整段 35 分钟的会议中,有 17 个可比较的 45 秒窗口。这些窗口的词错误率中位数为 36.8%,表现最好的窗口为 15.5%。
这些数字能说明三件事,但不能推导出第四件事。
它说明远距离会议录音难以转写。 麦克风放在桌子中央,三个人轮流或同时发言,是实际使用中相当困难的场景。因此,结果与“99%”相距甚远。
它说明错误集中在哪里。 房间里有三个声音,系统却只区分出两个。第三个人几乎不说完整句子,只用“okay”“yeah”和“mm-hmm”回应。该片段的七次简短回应中,有五次完全被漏掉。错误并非均匀分布,而是集中在短发言和较轻的声音上。
它提示应该优先改进什么。 对这类录音,不能指望只调一个软件参数就消除约 30% 的错误。给每个人配一个麦克风,可能更有帮助。
它不能预测您自己的文件会得到什么结果。 听听第二个访谈示例:同一套系统,在麦克风靠近说话人时,转写文本就流畅得多。会议示例是有意选取的高难度测试,不能代表所有文件。
如何转写自己的录音
1. 让麦克风尽量靠近嘴部。 一只价格适中的领夹麦克风,可能比反复调整软件设置更有效。
2. 知道录音语言时就手动指定,避免仅凭开头几秒自动判断。
3. 多人发言时,在开始转写前开启说话人区分。
4. 先确定交付文本的形式:需要保留犹豫和重复时,按完整逐字稿核对;不需要时,再整理副本。自动转写并不保证保留每个口头语。
5. 对照音频核对第一分钟。 姓名、专业术语和缩写容易出错,尤其值得人工检查。
您可以直接将音频转为文字,或将 MP4 转为转写文本,保留说话人区分和时间戳,需要字幕时再导出 SRT。
常见问题
音频转写文本是什么样的?
通常一列是时间戳,另一列是文字;每次发言单独成段,换人时显示说话人标签。单人录音可省略标签,多人录音则保留标签。
整理逐字稿与完整逐字稿有什么区别?
完整逐字稿保留所有说出的内容,包括犹豫、重复和未说完的起句。整理逐字稿去掉这些内容,不改变其余意思。研究和法律工作通常更需要完整记录;会议笔记往往不需要保留所有口语细节。
自动转写有多准确?
结果很大程度上取决于录音条件。上面的远距离会议录音,相对于公开人工参考文本的词错误率为 30.8%。像访谈这样近距离录制的语音,文本更清楚,但姓名和专业术语仍可能出错。没有评测音频支撑的单一准确率数字,不宜直接当作效果保证。
转写会包含说话人的真实姓名吗?
自动系统使用 `Speaker 1`、`Speaker 2` 等通用标签,因为仅凭声音无法知道每个人的身份。替换真实姓名需要人工完成,适合放在校对的最后一步。
可以转写视频吗?
可以。系统使用视频中的音轨,因此流程与音频转写相同。同一份结果也可以导出为字幕。