访谈逐字稿是按发言顺序记录对话,并标明每次发言者的文字材料。 实用的文档通常有日期与参与者信息、说话人标签、时间戳,以及表示非语言事件的方括号说明。
定义很简单,但许多指南的示例是为说明规则而编写的,不是真实录音的转写,因此显得过于整齐。实际访谈会有重复、设备调整和不确定的归属。
本文使用真实素材:Sausalito Historical Society 于 1985 年 1 月 5 日采访 Sally Stapp,当年她将满 80 岁。录音以公有领域方式提供。我们将 A 面前五分钟开启说话人区分后处理,先展示未经编辑的输出。
真实访谈转写示例
先听 36 秒片段。演示文本对应系统输出,可逐行对照。录音与引用保留英文原文,便于核验,而不是将译文误当成原话。
原始结果如下:
```
[00:02] SPEAKER_01: Now it's working.
[00:04] SPEAKER_01: Now it's working.
[00:05] SPEAKER_01: This is Sally Stapp and it is January 5th, 1985.
[00:10] SPEAKER_00: I don't know how to run this any better than I know.
[00:12] SPEAKER_01: Okay.
[00:13] SPEAKER_01: Sally, first thing I want to ask is when you when you came to Sausalito?
[00:18] SPEAKER_00: Right after World War II.
[00:20] SPEAKER_01: Where had you been before?
[00:23] SPEAKER_00: Naval Air Station, San Diego, for the duration.
[00:29] SPEAKER_01: Where are you from?
[00:31] SPEAKER_00: I was born in Cleveland, Ohio.
[00:32] SPEAKER_01: Cleveland, Ohio.
[00:33] SPEAKER_00: April 30th, 1905.
```
这十三行中有四个值得注意的细节。
“Now it's working”确实说了两次。 这不是应自动删掉的重复错误:录音里有人刚调好设备,重复确认它能用了。真实访谈未必从正式问题开始。
系统给出编号,不是真实姓名。 `SPEAKER_00`、`SPEAKER_01` 表示检测到的不同声音,系统并不知道谁是 Sally。需要人来核对并统一改名。
“when you when you”也是实际重复。 访谈者重新起句。完整逐字稿应保留,整理稿可以按事先声明的规则去掉一次。不能悄悄删掉,却仍把结果称为完整逐字稿。
00:10 的发言归属需要核对。 “I don't know how to run this any better than I know”被分配给 `SPEAKER_00`,但内容也可能来自正在调整设备的人。仅凭语义猜测不够,应回听确认;初始短发言和打断处尤其容易分错。
下面示范如何加上文档头、身份说明和不确定性标记。为了展示格式,片段保留全部原始行,不擅自把被另一人打断的两句合成一次发言:
```
访谈逐字稿
项目:口述历史项目,Sausalito Historical Society
日期:1985 年 1 月 5 日
地点:Sausalito,加利福尼亚州
参与者:Sally Stapp(1905 年 4 月 30 日出生)
访谈者:Sausalito Historical Society
录音:A 面,31 分 36 秒;本示例为开头片段
形式:保留原话的格式示例,待核对处已标注
来源:California Revealed/Internet Archive,公有领域
[00:02] 访谈者:Now it's working.
[00:04] 访谈者:Now it's working. [录音中确有重复]
[00:05] 访谈者:This is Sally Stapp and it is January 5th, 1985.
[00:10] 未确认:I don't know how to run this any better than I know.
[说话人归属待对照音频核实]
[00:12] 访谈者:Okay.
[00:13] 访谈者:Sally, first thing I want to ask is when you when you came to Sausalito?
[00:18] STAPP:Right after World War II.
[00:20] 访谈者:Where had you been before?
[00:23] STAPP:Naval Air Station, San Diego, for the duration.
[00:29] 访谈者:Where are you from?
[00:31] STAPP:I was born in Cleveland, Ohio.
[00:32] 访谈者:Cleveland, Ohio.
[00:33] STAPP:April 30th, 1905.
```
变化在于说明和标记,而不是偷偷改写原话。重复没有被无声删除,不确定的发言也没有强行分配给“看起来更可能”的人。
这就是为什么访谈逐字稿不能简单等同于工具刚生成的文件。
逐字稿是什么,又不是什么?
逐字稿记录说了什么,以及先后顺序,不是笔记、摘要或会议纪要。
研究、新闻及需要核实事实的场景尤其应区分。如果转写与录音不符,后续分析和引用也可能受影响。第一份记录宜尽量忠实,再另作适合发布或汇报的版本。
三种转写形式
选错形式,可能浪费时间,也可能删去研究所需的信息。
| 形式 | 保留内容 | 适用情况 | 限制 |
|---|---|---|---|
| 完整逐字稿 | 词句、犹豫、重启、重复及必要停顿,标注笑声、叹气等 | 会话、话语分析,以及表达方式本身重要的工作 | 制作和阅读更费时 |
| 整理逐字稿 | 实质内容,按声明规则去除非必要口头语和中断起句 | 部分主题分析、采访整理和播客文稿 | 需要判断哪些细节具有意义 |
| 编辑稿 | 核心内容,可删去旁支和偏题部分 | 出版、内部报告和案例介绍 | 不再是完整记录,不应只保留这一份 |
开始前选定,并在文档头写明。 否则读者无法判断某段流畅表达来自原话,还是后期删掉了犹豫。
实际有多少口头语?
原文对 934 段英语双人录音的系统转写文本统计了几种表达:
| 英文表达 | 每千词平均次数 | 4,620 词访谈的近似次数 |
|---|---|---|
| um | 2.16 | 约 10 |
| uh | 0.92 | 约 4 |
| you know | 5.20 | 约 24 |
| like | 17.40 | 约 80 |
有几个限制:like 的次数包含普通语义用法,不全是口头语;平均数不能代表每个人;自动转写可能漏掉短回应,因此也不是对所有实际发声的完整计数。更不能将这些英语频率当成中文“嗯”“那个”的统计。
即使去掉约四十次前三类表达,也不会让四千多词的文档骤然变短。选择整理稿的理由应是分析不需要这些细节,而不是单纯节省篇幅。可能有意义的犹豫,应保留在主记录中。
访谈逐字稿的三个组成部分
1. 文档头
让未来的读者知道材料从何而来、怎样处理过:
```
项目:[研究或项目名称]
日期:[访谈日期]
地点:[地点,或“远程 — Zoom”]
参与者:[姓名/化名及必要信息]
访谈者:[姓名或代号]
录音:[文件名与总时长]
形式:[完整逐字稿/整理逐字稿/编辑稿]
匿名化:[是/否]
同意记录:[已签署文件或授权记录的引用]
```
最容易漏掉的是形式和匿名化。缺少前者,不知道文字为何流畅;缺少后者,半年后可能分不清“王女士”是真实身份还是化名。
2. 正文
1. 每段只放一个人的发言。 即使回答只有一个词,也不要与提问者混在一起。
2. 标签一致,后接冒号。 例如 `访谈者:`、`P1:`,不要中途更换写法,便于分析软件识别。
3. 时间戳以便于回听为准。 短访谈可在换人时标记,长访谈可每 30–60 秒标记,不必机械地每三秒插一次。
4. 非语言信息放在方括号中。 例如 `[笑声]`、`[停顿]`、`[电话铃声]`、`[重叠发言]`、`[听不清 00:14:22]`。
5. 标出不确定,而不是装作确定。 `[存疑:Kessler?]` 比无提示写入一个错误姓名更有用。
3. 研究用行号
要精确引用时,可加入稳定行号,例如“P4,第 212–218 行”。最好在最终校对后生成;文本仍频繁变动时不断重排行号,可能使已有引用指向错误位置。
发言分布对排版有什么启示?
原文统计 1,248 段至少五分钟的双人录音,时长中位数为 29.9 分钟。其中 1,030 段可统计每人发言时长,较多发言者的占比中位数为 72.4%,第 90 百分位为 88.7%。
这提示两点,但样本并不等于全部经过人工确认的研究访谈。
段落长度不均匀是正常的。 访谈参与者可能说得远多于提问者。本文五分钟口述历史样本中,参与者占 85.8%,访谈者占 14.2%。如果另一段录音接近各一半,也可能反映真实交谈方式,而不是排版错误。
系统片段很多,不等于每段都要独立成段。 原文样本的片段数中位数为 391。应按换人和自然语义组织段落,避免一页不换段,也不要把算法每次切分都机械当成新发言。
人工听打的工作流程
1. 按需要将播放速度调至约 75%。 使用有键盘快捷键的播放器,比不断追赶正常语速更容易保持节奏。
2. 设置回退五秒的快捷键或脚踏控制。 减少反复移动鼠标。
3. 第一遍记录内容。 不因查名字或格式化而频繁打断;不清楚处标 `[?]`。
4. 第二遍处理疑点。 对照录音查姓名、数字和术语,必要时使用获准的辅助资料。
5. 最后统一格式。 加文档头、标签、时间戳和稳定行号。
完整人工逐字稿常按每小时音频需要四至六小时规划。约半小时访谈可能需要两至三小时;实际取决于录音、语言和标准,并非固定工时。
自动转写把时间花在哪里?
自动转写不是免去人工,而是把工作从逐字输入转移到核对。
原文中 962 段已完成双人录音的端到端耗时中位数为 5.5 分钟,90% 在 45.5 分钟内完成。另报告约 6.5 倍实时速度,它是独立汇总指标,不应直接用其他两个中位数相除得到。上传大视频、网络、队列及处理选项都可能影响慢任务。
得到文字后仍要为校对留时间,不能把系统处理时间当成交付完整逐字稿的总时间。
实际流程:
1. 上传录音,在支持时开启说话人区分。
2. 核对并统一替换“说话人 1”“说话人 2”等标签。
3. 对照音频修正姓名、数字、术语和重叠片段。
4. 按预先约定的形式保留或整理口头语,并保留主记录。
5. 导出 DOCX 用于编辑、TXT 用于分析,或 PDF 用于固定版式存档。
定性研究中的访谈转写
匿名化要一致。 不仅替换参与者姓名,还要检查单位、同事、机构及可识别地点。身份对应表另存并限制访问,在文档头说明已匿名化。不能第一页用了化名,第九段却保留真实雇主。
完整保留问题。 回答常依赖问题的具体措辞;诱导性提问只有保留原话才能被发现。原文双人样本中较少发言者约占 28% 的中位发言时间,但这不证明每段较少发言者都是访谈者。无论比例多少,问题都具有解释价值。
编码分析前统一转写规则。 在一组访谈中途从完整逐字稿改为整理稿,可能把编辑差异误当成人的表达差异。
确认分析软件的导入方式。 ATLAS.ti、NVivo、MAXQDA 等工具可使用 DOCX 或纯文本,但标签和格式约定需按具体版本检查。保留 TXT 主副本有助于减少格式依赖。
常见错误
用自己的访谈测试
原文五分钟示例开启说话人区分后,记录的处理耗时约 80 秒。您可免注册试转写自己的前五分钟,评估真实材料,而不只是选好的演示;具体试用功能以页面提供的选项为准。
上传音频或视频,确认语言,核对文字与标签,再选导出格式。说话人、完整转写和 DOCX、PDF、SRT、VTT 等权限依套餐提供。
更多素材见三个可听转写示例。视频访谈见 MP4 转写指南;录制与校对方法见访谈转写技巧。
---
*素材:“Oral Interview w. Sally Stapp”,Sausalito Historical Society,1985 年 1 月 5 日,经 California Revealed 与 Internet Archive(casauhs_000095)提供,Public Domain Mark 1.0。2026 年 8 月 2 日处理 A 面前五分钟,开启说话人区分。第一份示例为未经编辑的输出。汇总数据来自 TranscribeNext 生产记录,时间为 2025 年 10 月 9 日至 2026 年 7 月 31 日。*