TranscribeNextTranscribeNext.com
Blog指南

音频转文字示例:听一听 3 段真实录音(2026)

📝

TranscribeNext 团队

阅读约需 12 分钟
转写示例转写示例音频转文字说话人标签逐字稿

音频转文字示例展示的是口语如何呈现为书面记录:左侧是时间戳,每次发言单独成段,说话人变化时标注身份。 两种常见形式是去除口头语的整理逐字稿,以及保留每个“嗯”和中断句的完整逐字稿。

Free

这些基本概念,各类指南的解释大同小异。但很少有指南让您直接听到示例对应的原始录音。

这一点比想象中更重要。录音棚里清晰录制的一段独白,与四个人围着桌子、共用桌中央一个麦克风的讨论,转写结果会很不一样。也许只有其中一种接近您的实际文件。因此,我们选取了三段真实录音:会议、访谈和语音留言。每段都附有系统生成的转写文本,并随播放逐词高亮。没有重新录入,也没有人工修正。

会议样本所属的语料库还提供了人工参考转写,因此本文最后会将系统结果与之对照,给出具体错误率。录音及对应转写保留英文原文,便于逐句核对;它们不是未翻译的界面内容。

示例 1:三人会议,麦克风离说话人较远

点击播放。高亮会跟随当前说出的单词,说话人变化时标签也随之变化。

听真实会议,对照转写
AMI 语料库 · 单个远距离麦克风 · 3 位说话人 · 0:48
0:00 / 0:48
来源:AMI Meeting Corpus 的 EN2002a 会议(CC BY 4.0),由桌子中央的单个麦克风录制。该片段体现了真实使用中较难的录音条件。转写和说话人标签均为未经编辑的系统输出:163 个词、10 个片段、识别出 2 个声音;人工参考为 208 个词、20 次发言、3 个声音。该片段词错误率为 30.8%。行与词的时间均来自实际对齐结果,不是插值。音频及对应转写保留英文原文,便于核对。

我们特意选择了一个较难的场景。麦克风不是夹在某个人衣领上,而是放在桌子中央,远距离收录所有人的声音,同时也收进房间里的回声。三个人交谈,时而互相打断。

请留意以下现象,它们能说明真实会议转写会出现什么问题:

  • 一句话被重复记录。 0:19 的“So did you have to write it in the way that they wrote it, is that what you did?”之后,0:21 又单独出现了“Is that what you did?”。实际上没有人重复说这句话。声音重叠可能导致这种重复转写。
  • 重叠发言变成了依次发言。 人工参考文本中,第二个人常常在第一个人尚未说完时就开始讲话。系统转写则将片段依次列出,以便在单列文本中阅读。原本同时发生的发言,看起来变成了先后发生。
  • 简短回应被漏掉。 在这 48 秒的人工参考文本中,三个人说过“okay”“right”“okeydoke”和“mm-hmm”等回应。系统结果中大部分没有出现。
  • 最后一点是自动转写在远距离录音中的真实局限。下文的准确性分析会给出具体数量。

    示例 2:麦克风靠近说话人的访谈

    听访谈,对照转写
    公有领域口述历史 · 0:36 · 未经编辑的转写
    0:00 / 0:35
    来源:“Oral Interview w. Sally Stapp”,Sausalito Historical Society,1985 年 1 月 5 日,经 California Revealed 与 Internet Archive(casauhs_000095)提供,Public Domain Mark 1.0,无使用限制。取前 36 秒,重新编码为 128 kbps 立体声网页音频。文本为该文件未经编辑的输出,因此保留录音中的“when you when you came to Sausalito”重复。片段由 V2 后端处理,行与词的时间来自实际对齐,不是插值。音频及转写保留英文原文,便于核对。

    使用的是同一套系统,阅读体验却完全不同。每次只有一个人发言,麦克风距离较近,也没有声音重叠。句子完整,标点与停顿相符,不需要费力辨别交叠的发言。

    与上一段会议对比,最有用的结论是:录音条件决定转写质量。 领夹麦克风或耳麦带来的改善,往往比调整软件参数更明显。

    示例 3:一位说话人,十六秒的语音留言

    听真实语音留言,对照转写
    CC0 录音 · 重新编码为电话音质 · 0:16
    0:00 / 0:15
    来源:Sample_Me 的“Woman Leaving a Phone Message”(Freesound,CC0 1.0)。音频经 μ-law 编码转为单声道 8 kHz,以模拟电话留言音质,而非录音棚条件。文本是该文件未经编辑的系统输出。行时间来自片段时间戳;逐词高亮在每行内插值计算。音频及对应转写保留英文原文,便于核对。

    单人短录音是相对简单的情况,也展示了最基础的转写形式:只有一个声音,不需要反复标注说话人;时间戳出现在每组句子的开头。

    日常的语音备忘录、课堂录音或口述笔记,通常就是这样呈现的:一列时间,一列文字。

    整理逐字稿与完整逐字稿

    两种形式对应同一段录音,区别在于删去了什么。

    完整逐字稿保留说话人的全部表达,包括本人未必希望被引用的部分。以下示例保留录音中的英文:

    ```

    0:08 I had to figure out how to how to do the same thing for the

    summary, that's how I see it.

    ```

    “how to how to”的重复不是转写错误,而是说话人确实重复了这些词。

    整理逐字稿会去掉重复、口头语和未说完的起句,不改变其余意思:

    ```

    0:08 I had to figure out how to do the same thing for the summary.

    ```

    选择哪一种,取决于文本的用途:

    | 用途 | 形式 | 原因 || --- | --- | --- || 定性研究、法律和医疗场景 | 完整逐字稿 | 犹豫和重复也可能是重要信息 || 会议笔记、内部记录 | 整理逐字稿 | 口语中的磕绊通常无助于阅读 || 发布、字幕和营销 | 整理逐字稿,再进行校对 | 优先保证可读性 || 语言与语音研究 | 完整逐字稿,加上非语言标记 | 包括 `[停顿]`、`[笑声]`、`[听不清]` |

    实用做法是先保留完整逐字稿,再整理一份副本。从完整版本整理出精简版本通常只需几分钟;反过来补回被删掉的细节,就得重新听录音。

    多人转写的格式

    不止一人发言时,转写需要说明是谁在说话。通常每次发言单独成段,将说话人标签放在左侧或上方。下例保留英文原话:

    ```

    Speaker 1 So did you have to write it in the way that they wrote it,

    is that what you did?

    Speaker 2 Yeah, just search for specific string.

    Speaker 1 Fish the data, I was just thinking that, yeah.

    ```

    会议示例体现了三条实用规则:

    1. 不要把两个人的发言合在同一段。 一段里混入两个声音,会增加引用、研究编码和查找的难度。

    2. 换人时标注,不必每行都标。 连续六行都写“说话人 1”,反而干扰阅读。

    3. 最后统一替换姓名。 自动系统使用 `Speaker 1`、`Speaker 2` 等通用标签。校对完文字后,再替换为真实姓名即可。

    视频转写是什么样的

    视频转写依据的是音轨,画面内容不会自动补充到转写文本中。主要区别在于时间戳的后续用途:

  • 转写文本:在自然停顿处标注时间,方便阅读和查找。
  • SRT/VTT 字幕:将同样的文字切成带起止时间的字幕块,通常每块显示约 1 至 7 秒,并调整长度以适合屏幕上的两行文字。
  • 同一份录音可以生成两种结果。导出 SRT 是格式转换,而不是重新转写。如果需要字幕,先完成转写,再调整字幕块的切分与时长。

    很少被公开的准确性数据

    许多示例页面到了准确性问题上就不够具体。原文调查时,SpeakWrite 宣称“99%–100% 准确率”,TranscribeMe 宣称“99%+”,但所引用的页面没有同时提供对应音频和评测用参考转写。缺少这些材料,就无法独立核验或直接比较这些百分比。

    上面的会议样本可以核对,因为 AMI 语料库提供了人工参考文本。下面是 48 秒片段的对照:

    | | 人工参考文本 | 系统转写 || --- | --- | --- || 词数 | 208 | 163 || 发言次数/片段数 | 20 | 10 || 说话人数 | 3 | 2 || “okay”“right”“mm-hmm”等简短回应 | 7 | 2 |

    该片段的词错误率为 30.8%:41 处替换、17 处遗漏和 6 处插入。

    整段 35 分钟的会议中,有 17 个可比较的 45 秒窗口。这些窗口的词错误率中位数为 36.8%,表现最好的窗口为 15.5%。

    这些数字能说明三件事,但不能推导出第四件事。

    它说明远距离会议录音难以转写。 麦克风放在桌子中央,三个人轮流或同时发言,是实际使用中相当困难的场景。因此,结果与“99%”相距甚远。

    它说明错误集中在哪里。 房间里有三个声音,系统却只区分出两个。第三个人几乎不说完整句子,只用“okay”“yeah”和“mm-hmm”回应。该片段的七次简短回应中,有五次完全被漏掉。错误并非均匀分布,而是集中在短发言和较轻的声音上。

    它提示应该优先改进什么。 对这类录音,不能指望只调一个软件参数就消除约 30% 的错误。给每个人配一个麦克风,可能更有帮助。

    它不能预测您自己的文件会得到什么结果。 听听第二个访谈示例:同一套系统,在麦克风靠近说话人时,转写文本就流畅得多。会议示例是有意选取的高难度测试,不能代表所有文件。

    如何转写自己的录音

    1. 让麦克风尽量靠近嘴部。 一只价格适中的领夹麦克风,可能比反复调整软件设置更有效。

    2. 知道录音语言时就手动指定,避免仅凭开头几秒自动判断。

    3. 多人发言时,在开始转写前开启说话人区分。

    4. 先确定交付文本的形式:需要保留犹豫和重复时,按完整逐字稿核对;不需要时,再整理副本。自动转写并不保证保留每个口头语。

    5. 对照音频核对第一分钟。 姓名、专业术语和缩写容易出错,尤其值得人工检查。

    您可以直接将音频转为文字,或将 MP4 转为转写文本,保留说话人区分和时间戳,需要字幕时再导出 SRT。

    常见问题

    音频转写文本是什么样的?

    通常一列是时间戳,另一列是文字;每次发言单独成段,换人时显示说话人标签。单人录音可省略标签,多人录音则保留标签。

    整理逐字稿与完整逐字稿有什么区别?

    完整逐字稿保留所有说出的内容,包括犹豫、重复和未说完的起句。整理逐字稿去掉这些内容,不改变其余意思。研究和法律工作通常更需要完整记录;会议笔记往往不需要保留所有口语细节。

    自动转写有多准确?

    结果很大程度上取决于录音条件。上面的远距离会议录音,相对于公开人工参考文本的词错误率为 30.8%。像访谈这样近距离录制的语音,文本更清楚,但姓名和专业术语仍可能出错。没有评测音频支撑的单一准确率数字,不宜直接当作效果保证。

    转写会包含说话人的真实姓名吗?

    自动系统使用 `Speaker 1`、`Speaker 2` 等通用标签,因为仅凭声音无法知道每个人的身份。替换真实姓名需要人工完成,适合放在校对的最后一步。

    可以转写视频吗?

    可以。系统使用视频中的音轨,因此流程与音频转写相同。同一份结果也可以导出为字幕。

    准备好转写您的音频了吗?

    免费体验 TranscribeNext 的 AI 转写

    免费开始使用,无需信用卡

    © 2026 TranscribeNext.com. 保留所有权利。

    音频转文字示例:3 段真实录音与转写结果(2026) | TranscribeNext