TranscribeNextTranscribeNext.com
Blog指南

访谈逐字稿:格式、整理方法与真实示例

📝

TranscribeNext 团队

阅读约需 14 分钟
访谈逐字稿转写格式定性研究转写口述历史

访谈逐字稿是按发言顺序记录对话,并标明每次发言者的文字材料。 实用的文档通常有日期与参与者信息、说话人标签、时间戳,以及表示非语言事件的方括号说明。

Free

定义很简单,但许多指南的示例是为说明规则而编写的,不是真实录音的转写,因此显得过于整齐。实际访谈会有重复、设备调整和不确定的归属。

本文使用真实素材:Sausalito Historical Society 于 1985 年 1 月 5 日采访 Sally Stapp,当年她将满 80 岁。录音以公有领域方式提供。我们将 A 面前五分钟开启说话人区分后处理,先展示未经编辑的输出。

真实访谈转写示例

先听 36 秒片段。演示文本对应系统输出,可逐行对照。录音与引用保留英文原文,便于核验,而不是将译文误当成原话。

听访谈,对照转写
公有领域口述历史 · 0:36 · 未经编辑的转写
0:00 / 0:35
来源:“Oral Interview w. Sally Stapp”,Sausalito Historical Society,1985 年 1 月 5 日,经 California Revealed 与 Internet Archive(casauhs_000095)提供,Public Domain Mark 1.0,无使用限制。取前 36 秒,重新编码为 128 kbps 立体声网页音频。文本为该文件未经编辑的输出,因此保留录音中的“when you when you came to Sausalito”重复。片段由 V2 后端处理,行与词的时间来自实际对齐,不是插值。音频及转写保留英文原文,便于核对。

原始结果如下:

```

[00:02] SPEAKER_01: Now it's working.

[00:04] SPEAKER_01: Now it's working.

[00:05] SPEAKER_01: This is Sally Stapp and it is January 5th, 1985.

[00:10] SPEAKER_00: I don't know how to run this any better than I know.

[00:12] SPEAKER_01: Okay.

[00:13] SPEAKER_01: Sally, first thing I want to ask is when you when you came to Sausalito?

[00:18] SPEAKER_00: Right after World War II.

[00:20] SPEAKER_01: Where had you been before?

[00:23] SPEAKER_00: Naval Air Station, San Diego, for the duration.

[00:29] SPEAKER_01: Where are you from?

[00:31] SPEAKER_00: I was born in Cleveland, Ohio.

[00:32] SPEAKER_01: Cleveland, Ohio.

[00:33] SPEAKER_00: April 30th, 1905.

```

这十三行中有四个值得注意的细节。

“Now it's working”确实说了两次。 这不是应自动删掉的重复错误:录音里有人刚调好设备,重复确认它能用了。真实访谈未必从正式问题开始。

系统给出编号,不是真实姓名。 `SPEAKER_00`、`SPEAKER_01` 表示检测到的不同声音,系统并不知道谁是 Sally。需要人来核对并统一改名。

“when you when you”也是实际重复。 访谈者重新起句。完整逐字稿应保留,整理稿可以按事先声明的规则去掉一次。不能悄悄删掉,却仍把结果称为完整逐字稿。

00:10 的发言归属需要核对。 “I don't know how to run this any better than I know”被分配给 `SPEAKER_00`,但内容也可能来自正在调整设备的人。仅凭语义猜测不够,应回听确认;初始短发言和打断处尤其容易分错。

下面示范如何加上文档头、身份说明和不确定性标记。为了展示格式,片段保留全部原始行,不擅自把被另一人打断的两句合成一次发言:

```

访谈逐字稿

项目:口述历史项目,Sausalito Historical Society

日期:1985 年 1 月 5 日

地点:Sausalito,加利福尼亚州

参与者:Sally Stapp(1905 年 4 月 30 日出生)

访谈者:Sausalito Historical Society

录音:A 面,31 分 36 秒;本示例为开头片段

形式:保留原话的格式示例,待核对处已标注

来源:California Revealed/Internet Archive,公有领域

[00:02] 访谈者:Now it's working.

[00:04] 访谈者:Now it's working. [录音中确有重复]

[00:05] 访谈者:This is Sally Stapp and it is January 5th, 1985.

[00:10] 未确认:I don't know how to run this any better than I know.

[说话人归属待对照音频核实]

[00:12] 访谈者:Okay.

[00:13] 访谈者:Sally, first thing I want to ask is when you when you came to Sausalito?

[00:18] STAPP:Right after World War II.

[00:20] 访谈者:Where had you been before?

[00:23] STAPP:Naval Air Station, San Diego, for the duration.

[00:29] 访谈者:Where are you from?

[00:31] STAPP:I was born in Cleveland, Ohio.

[00:32] 访谈者:Cleveland, Ohio.

[00:33] STAPP:April 30th, 1905.

```

变化在于说明和标记,而不是偷偷改写原话。重复没有被无声删除,不确定的发言也没有强行分配给“看起来更可能”的人。

这就是为什么访谈逐字稿不能简单等同于工具刚生成的文件。

逐字稿是什么,又不是什么?

逐字稿记录说了什么,以及先后顺序,不是笔记、摘要或会议纪要。

  • 笔记记录听者认为重要的内容。
  • 摘要归纳谈话的主要意思。
  • 逐字稿是前两者可以回溯的文字依据。
  • 研究、新闻及需要核实事实的场景尤其应区分。如果转写与录音不符,后续分析和引用也可能受影响。第一份记录宜尽量忠实,再另作适合发布或汇报的版本。

    三种转写形式

    选错形式,可能浪费时间,也可能删去研究所需的信息。

    形式保留内容适用情况限制
    完整逐字稿词句、犹豫、重启、重复及必要停顿,标注笑声、叹气等会话、话语分析,以及表达方式本身重要的工作制作和阅读更费时
    整理逐字稿实质内容,按声明规则去除非必要口头语和中断起句部分主题分析、采访整理和播客文稿需要判断哪些细节具有意义
    编辑稿核心内容,可删去旁支和偏题部分出版、内部报告和案例介绍不再是完整记录,不应只保留这一份

    开始前选定,并在文档头写明。 否则读者无法判断某段流畅表达来自原话,还是后期删掉了犹豫。

    实际有多少口头语?

    原文对 934 段英语双人录音的系统转写文本统计了几种表达:

    英文表达每千词平均次数4,620 词访谈的近似次数
    um2.16约 10
    uh0.92约 4
    you know5.20约 24
    like17.40约 80

    有几个限制:like 的次数包含普通语义用法,不全是口头语;平均数不能代表每个人;自动转写可能漏掉短回应,因此也不是对所有实际发声的完整计数。更不能将这些英语频率当成中文“嗯”“那个”的统计。

    即使去掉约四十次前三类表达,也不会让四千多词的文档骤然变短。选择整理稿的理由应是分析不需要这些细节,而不是单纯节省篇幅。可能有意义的犹豫,应保留在主记录中。

    访谈逐字稿的三个组成部分

    让未来的读者知道材料从何而来、怎样处理过:

    ```

    项目:[研究或项目名称]

    日期:[访谈日期]

    地点:[地点,或“远程 — Zoom”]

    参与者:[姓名/化名及必要信息]

    访谈者:[姓名或代号]

    录音:[文件名与总时长]

    形式:[完整逐字稿/整理逐字稿/编辑稿]

    匿名化:[是/否]

    同意记录:[已签署文件或授权记录的引用]

    ```

    最容易漏掉的是形式和匿名化。缺少前者,不知道文字为何流畅;缺少后者,半年后可能分不清“王女士”是真实身份还是化名。

    2. 正文

    1. 每段只放一个人的发言。 即使回答只有一个词,也不要与提问者混在一起。

    2. 标签一致,后接冒号。 例如 `访谈者:`、`P1:`,不要中途更换写法,便于分析软件识别。

    3. 时间戳以便于回听为准。 短访谈可在换人时标记,长访谈可每 30–60 秒标记,不必机械地每三秒插一次。

    4. 非语言信息放在方括号中。 例如 `[笑声]`、`[停顿]`、`[电话铃声]`、`[重叠发言]`、`[听不清 00:14:22]`。

    5. 标出不确定,而不是装作确定。 `[存疑:Kessler?]` 比无提示写入一个错误姓名更有用。

    3. 研究用行号

    要精确引用时,可加入稳定行号,例如“P4,第 212–218 行”。最好在最终校对后生成;文本仍频繁变动时不断重排行号,可能使已有引用指向错误位置。

    发言分布对排版有什么启示?

    原文统计 1,248 段至少五分钟的双人录音,时长中位数为 29.9 分钟。其中 1,030 段可统计每人发言时长,较多发言者的占比中位数为 72.4%,第 90 百分位为 88.7%。

    这提示两点,但样本并不等于全部经过人工确认的研究访谈。

    段落长度不均匀是正常的。 访谈参与者可能说得远多于提问者。本文五分钟口述历史样本中,参与者占 85.8%,访谈者占 14.2%。如果另一段录音接近各一半,也可能反映真实交谈方式,而不是排版错误。

    系统片段很多,不等于每段都要独立成段。 原文样本的片段数中位数为 391。应按换人和自然语义组织段落,避免一页不换段,也不要把算法每次切分都机械当成新发言。

    人工听打的工作流程

    1. 按需要将播放速度调至约 75%。 使用有键盘快捷键的播放器,比不断追赶正常语速更容易保持节奏。

    2. 设置回退五秒的快捷键或脚踏控制。 减少反复移动鼠标。

    3. 第一遍记录内容。 不因查名字或格式化而频繁打断;不清楚处标 `[?]`。

    4. 第二遍处理疑点。 对照录音查姓名、数字和术语,必要时使用获准的辅助资料。

    5. 最后统一格式。 加文档头、标签、时间戳和稳定行号。

    完整人工逐字稿常按每小时音频需要四至六小时规划。约半小时访谈可能需要两至三小时;实际取决于录音、语言和标准,并非固定工时。

    自动转写把时间花在哪里?

    自动转写不是免去人工,而是把工作从逐字输入转移到核对。

    原文中 962 段已完成双人录音的端到端耗时中位数为 5.5 分钟,90% 在 45.5 分钟内完成。另报告约 6.5 倍实时速度,它是独立汇总指标,不应直接用其他两个中位数相除得到。上传大视频、网络、队列及处理选项都可能影响慢任务。

    得到文字后仍要为校对留时间,不能把系统处理时间当成交付完整逐字稿的总时间。

    实际流程:

    1. 上传录音,在支持时开启说话人区分。

    2. 核对并统一替换“说话人 1”“说话人 2”等标签。

    3. 对照音频修正姓名、数字、术语和重叠片段。

    4. 按预先约定的形式保留或整理口头语,并保留主记录。

    5. 导出 DOCX 用于编辑、TXT 用于分析,或 PDF 用于固定版式存档。

    定性研究中的访谈转写

    匿名化要一致。 不仅替换参与者姓名,还要检查单位、同事、机构及可识别地点。身份对应表另存并限制访问,在文档头说明已匿名化。不能第一页用了化名,第九段却保留真实雇主。

    完整保留问题。 回答常依赖问题的具体措辞;诱导性提问只有保留原话才能被发现。原文双人样本中较少发言者约占 28% 的中位发言时间,但这不证明每段较少发言者都是访谈者。无论比例多少,问题都具有解释价值。

    编码分析前统一转写规则。 在一组访谈中途从完整逐字稿改为整理稿,可能把编辑差异误当成人的表达差异。

    确认分析软件的导入方式。 ATLAS.ti、NVivo、MAXQDA 等工具可使用 DOCX 或纯文本,但标签和格式约定需按具体版本检查。保留 TXT 主副本有助于减少格式依赖。

    常见错误

  • 两个人合在同一段:影响引用与自动分析。
  • 删除重复却称为完整逐字稿:形式说明与内容不符。
  • 每行都加时间:可能干扰阅读,应按用途决定密度。
  • 猜测听不清的词而不标记:错误可能进入正式引用。
  • 使用通信应用压缩过的副本:有原文件时应优先使用原文件。
  • 最终文档仍留未核对的通用说话人标签:应明确身份或保留“未确认”,不要随意分配。
  • 没有文档头:以后难以确定来源和处理规则。
  • 用自己的访谈测试

    原文五分钟示例开启说话人区分后,记录的处理耗时约 80 秒。您可免注册试转写自己的前五分钟,评估真实材料,而不只是选好的演示;具体试用功能以页面提供的选项为准。

    上传音频或视频,确认语言,核对文字与标签,再选导出格式。说话人、完整转写和 DOCX、PDF、SRT、VTT 等权限依套餐提供。

    更多素材见三个可听转写示例。视频访谈见 MP4 转写指南;录制与校对方法见访谈转写技巧。

    ---

    *素材:“Oral Interview w. Sally Stapp”,Sausalito Historical Society,1985 年 1 月 5 日,经 California Revealed 与 Internet Archive(casauhs_000095)提供,Public Domain Mark 1.0。2026 年 8 月 2 日处理 A 面前五分钟,开启说话人区分。第一份示例为未经编辑的输出。汇总数据来自 TranscribeNext 生产记录,时间为 2025 年 10 月 9 日至 2026 年 7 月 31 日。*

    准备好转写您的音频了吗?

    免费体验 TranscribeNext 的 AI 转写

    免费开始使用,无需信用卡

    © 2026 TranscribeNext.com. 保留所有权利。

    访谈转写如何排版:格式规范与真实录音示例 | TranscribeNext