訪談逐字稿是按發言順序記錄對話,並標明每次發言者的文字材料。 實用的文件通常有日期與參與者資訊、講者標籤、時間戳記,以及表示非語言事件的方括號說明。
定義很簡單,但許多指南的示例是為說明規則而編寫的,不是真實錄音的轉錄,因此顯得過於整齊。實際訪談會有重復、裝置調整和不確定的歸屬。
本文使用真實素材:Sausalito Historical Society 於 1985 年 1 月 5 日採訪 Sally Stapp,當年她將滿 80 歲。錄音以公有領域方式提供。我們將 A 面前五分鐘開啓講者辨識後處理,先展示未經編輯的輸出。
真實訪談轉錄示例
先聽 36 秒片段。演示文字對應系統輸出,可逐行對照。錄音與引用保留英文原文,便於核驗,而不是將譯文誤當成原話。
原始結果如下:
```
[00:02] SPEAKER_01: Now it's working.
[00:04] SPEAKER_01: Now it's working.
[00:05] SPEAKER_01: This is Sally Stapp and it is January 5th, 1985.
[00:10] SPEAKER_00: I don't know how to run this any better than I know.
[00:12] SPEAKER_01: Okay.
[00:13] SPEAKER_01: Sally, first thing I want to ask is when you when you came to Sausalito?
[00:18] SPEAKER_00: Right after World War II.
[00:20] SPEAKER_01: Where had you been before?
[00:23] SPEAKER_00: Naval Air Station, San Diego, for the duration.
[00:29] SPEAKER_01: Where are you from?
[00:31] SPEAKER_00: I was born in Cleveland, Ohio.
[00:32] SPEAKER_01: Cleveland, Ohio.
[00:33] SPEAKER_00: April 30th, 1905.
```
這十三行中有四個值得注意的細節。
“Now it's working”確實說了兩次。 這不是應自動刪掉的重復錯誤:錄音里有人剛調好裝置,重復確認它能用了。真實訪談未必從正式問題開始。
系統給出編號,不是真實姓名。 `SPEAKER_00`、`SPEAKER_01` 表示偵測到的不同聲音,系統並不知道誰是 Sally。需要人來核對並統一改名。
“when you when you”也是實際重復。 訪談者重新起句。完整逐字稿應保留,整理稿可以按事先聲明的規則去掉一次。不能悄悄刪掉,卻仍把結果稱為完整逐字稿。
00:10 的發言歸屬需要核對。 “I don't know how to run this any better than I know”被分配給 `SPEAKER_00`,但內容也可能來自正在調整裝置的人。僅憑語義猜測不夠,應回聽確認;初始短發言和打斷處尤其容易分錯。
下面示範如何加上文件頭、身份說明和不確定性標記。為了展示格式,片段保留全部原始行,不擅自把被另一人打斷的兩句合成一次發言:
```
訪談逐字稿
專案:口述歷史專案,Sausalito Historical Society
日期:1985 年 1 月 5 日
地點:Sausalito,加利福尼亞州
參與者:Sally Stapp(1905 年 4 月 30 日出生)
訪談者:Sausalito Historical Society
錄音:A 面,31 分 36 秒;本示例為開頭片段
形式:保留原話的格式示例,待核對處已標註
來源:California Revealed/Internet Archive,公有領域
[00:02] 訪談者:Now it's working.
[00:04] 訪談者:Now it's working. [錄音中確有重復]
[00:05] 訪談者:This is Sally Stapp and it is January 5th, 1985.
[00:10] 未確認:I don't know how to run this any better than I know.
[講者歸屬待對照音訊核實]
[00:12] 訪談者:Okay.
[00:13] 訪談者:Sally, first thing I want to ask is when you when you came to Sausalito?
[00:18] STAPP:Right after World War II.
[00:20] 訪談者:Where had you been before?
[00:23] STAPP:Naval Air Station, San Diego, for the duration.
[00:29] 訪談者:Where are you from?
[00:31] STAPP:I was born in Cleveland, Ohio.
[00:32] 訪談者:Cleveland, Ohio.
[00:33] STAPP:April 30th, 1905.
```
變化在於說明和標記,而不是偷偷改寫原話。重復沒有被無聲刪除,不確定的發言也沒有強行分配給“看起來更可能”的人。
這就是為什麼訪談逐字稿不能簡單等同於工具剛生成的檔案。
逐字稿是什麼,又不是什麼?
逐字稿記錄說了什麼,以及先後順序,不是筆記、摘要或會議紀要。
研究、新聞及需要核實事實的場景尤其應區分。如果轉錄與錄音不符,後續分析和引用也可能受影響。第一份記錄宜盡量忠實,再另作適合發佈或彙報的版本。
三種轉錄形式
選錯形式,可能浪費時間,也可能刪去研究所需的資訊。
| 形式 | 保留內容 | 適用情況 | 限制 |
|---|---|---|---|
| 完整逐字稿 | 詞句、猶豫、重啓、重復及必要停頓,標註笑聲、嘆氣等 | 會話、話語分析,以及表達方式本身重要的工作 | 製作和閱讀更費時 |
| 整理逐字稿 | 實質內容,按聲明規則去除非必要口頭語和中斷起句 | 部分主題分析、採訪整理和Podcast文稿 | 需要判斷哪些細節具有意義 |
| 編輯稿 | 核心內容,可刪去旁支和偏題部分 | 出版、內部報告和案例介紹 | 不再是完整記錄,不應只保留這一份 |
開始前選定,並在文件頭寫明。 否則讀者無法判斷某段流暢表達來自原話,還是後期刪掉了猶豫。
實際有多少口頭語?
原文對 934 段英語雙人錄音的系統逐字稿統計了幾種表達:
| 英文表達 | 每千詞平均次數 | 4,620 詞訪談的近似次數 |
|---|---|---|
| um | 2.16 | 約 10 |
| uh | 0.92 | 約 4 |
| you know | 5.20 | 約 24 |
| like | 17.40 | 約 80 |
有幾個限制:like 的次數包含普通語義用法,不全是口頭語;平均數不能代表每個人;自動轉錄可能漏掉短回應,因此也不是對所有實際發聲的完整計數。更不能將這些英語頻率當成中文“嗯”“那個”的統計。
即使去掉約四十次前三類表達,也不會讓四千多詞的文件驟然變短。選擇整理稿的理由應是分析不需要這些細節,而不是單純節省篇幅。可能有意義的猶豫,應保留在主記錄中。
訪談逐字稿的三個組成部分
1. 文件頭
讓未來的讀者知道材料從何而來、怎樣處理過:
```
專案:[研究或專案名稱]
日期:[訪談日期]
地點:[地點,或“遠程 — Zoom”]
參與者:[姓名/化名及必要資訊]
訪談者:[姓名或代號]
錄音:[檔案名與總時長]
形式:[完整逐字稿/整理逐字稿/編輯稿]
匿名化:[是/否]
同意記錄:[已簽署檔案或授權記錄的引用]
```
最容易漏掉的是形式和匿名化。缺少前者,不知道文字為何流暢;缺少後者,半年後可能分不清“王女士”是真實身份還是化名。
2. 正文
1. 每段只放一個人的發言。 即使回答只有一個詞,也不要與提問者混在一起。
2. 標籤一致,後接冒號。 例如 `訪談者:`、`P1:`,不要中途更換寫法,便於分析軟體辨識。
3. 時間戳記以便於回聽為準。 短訪談可在換人時標記,長訪談可每 30–60 秒標記,不必機械地每三秒插一次。
4. 非語言資訊放在方括號中。 例如 `[笑聲]`、`[停頓]`、`[電話鈴聲]`、`[重疊發言]`、`[聽不清 00:14:22]`。
5. 標出不確定,而不是裝作確定。 `[存疑:Kessler?]` 比無提示寫入一個錯誤姓名更有用。
3. 研究用行號
要精確引用時,可加入穩定行號,例如“P4,第 212–218 行”。最好在最終校對後生成;文字仍頻繁變動時不斷重排行號,可能使已有引用指向錯誤位置。
發言分布對排版有什麼啓示?
原文統計 1,248 段至少五分鐘的雙人錄音,時長中位數為 29.9 分鐘。其中 1,030 段可統計每人發言時長,較多發言者的佔比中位數為 72.4%,第 90 百分位為 88.7%。
這提示兩點,但樣本並不等於全部經過人工確認的研究訪談。
段落長度不均勻是正常的。 訪談參與者可能說得遠多於提問者。本文五分鐘口述歷史樣本中,參與者佔 85.8%,訪談者佔 14.2%。如果另一段錄音接近各一半,也可能反映真實交談方式,而不是排版錯誤。
系統片段很多,不等於每段都要獨立成段。 原文樣本的片段數中位數為 391。應按換人和自然語義組織段落,避免一頁不換段,也不要把算法每次切分都機械當成新發言。
人工聽打的工作流程
1. 按需要將播放速度調至約 75%。 使用有鍵盤快捷鍵的播放器,比不斷追趕正常語速更容易保持節奏。
2. 設定回退五秒的快捷鍵或腳踏控制。 減少反復移動滑鼠。
3. 第一遍記錄內容。 不因查名字或格式化而頻繁打斷;不清楚處標 `[?]`。
4. 第二遍處理疑點。 對照錄音查姓名、數字和術語,必要時使用獲准的輔助資料。
5. 最後統一格式。 加文件頭、標籤、時間戳記和穩定行號。
完整人工逐字稿常按每小時音訊需要四至六小時規劃。約半小時訪談可能需要兩至三小時;實際取決於錄音、語言和標準,並非固定工時。
自動轉錄把時間花在哪裡?
自動轉錄不是免去人工,而是把工作從逐字輸入轉移到核對。
原文中 962 段已完成雙人錄音的端到端耗時中位數為 5.5 分鐘,90% 在 45.5 分鐘內完成。另報告約 6.5 倍即時速度,它是獨立匯總指標,不應直接用其他兩個中位數相除得到。上傳大影片、網路、隊列及處理選項都可能影響慢任務。
得到文字後仍要為校對留時間,不能把系統處理時間當成交付完整逐字稿的總時間。
實際流程:
1. 上傳錄音,在支援時開啓講者辨識。
2. 核對並統一替換“講者 1”“講者 2”等標籤。
3. 對照音訊修正姓名、數字、術語和重疊片段。
4. 按預先約定的形式保留或整理口頭語,並保留主記錄。
5. 匯出 DOCX 用於編輯、TXT 用於分析,或 PDF 用於固定版式存檔。
定性研究中的訪談轉錄
匿名化要一致。 不僅替換參與者姓名,還要檢查單位、同事、機構及可辨識地點。身份對應表另存並限制訪問,在文件頭說明已匿名化。不能第一頁用了化名,第九段卻保留真實雇主。
完整保留問題。 回答常依賴問題的具體措辭;誘導性提問只有保留原話才能被發現。原文雙人樣本中較少發言者約佔 28% 的中位發言時間,但這不證明每段較少發言者都是訪談者。無論比例多少,問題都具有解釋價值。
編碼分析前統一轉錄規則。 在一組訪談中途從完整逐字稿改為整理稿,可能把編輯差異誤當成人的表達差異。
確認分析軟體的匯入方式。 ATLAS.ti、NVivo、MAXQDA 等工具可使用 DOCX 或純文字,但標籤和格式約定需按具體版本檢查。保留 TXT 主副本有助於減少格式依賴。
常見錯誤
用自己的訪談測試
原文五分鐘示例開啓講者辨識後,記錄的處理耗時約 80 秒。您可免註冊試轉錄自己的前五分鐘,評估真實材料,而不只是選好的演示;具體試用功能以頁面提供的選項為準。
上傳音訊或影片,確認語言,核對文字與標籤,再選匯出格式。講者、完整轉錄和 DOCX、PDF、SRT、VTT 等權限依方案提供。
更多素材見三個可聽轉錄示例。影片訪談見 MP4 轉錄指南;錄製與校對方法見訪談轉錄技巧。
---
*素材:“Oral Interview w. Sally Stapp”,Sausalito Historical Society,1985 年 1 月 5 日,經 California Revealed 與 Internet Archive(casauhs_000095)提供,Public Domain Mark 1.0。2026 年 8 月 2 日處理 A 面前五分鐘,開啓講者辨識。第一份示例為未經編輯的輸出。匯總資料來自 TranscribeNext 生產記錄,時間為 2025 年 10 月 9 日至 2026 年 7 月 31 日。*