TranscribeNextTranscribeNext.com
Blog指南

訪談逐字稿:格式、整理方法與真實示例

📝

TranscribeNext 團隊

閱讀約需 14 分鐘
訪談逐字稿轉錄格式定性研究轉錄口述歷史

訪談逐字稿是按發言順序記錄對話,並標明每次發言者的文字材料。 實用的文件通常有日期與參與者資訊、講者標籤、時間戳記,以及表示非語言事件的方括號說明。

Free

定義很簡單,但許多指南的示例是為說明規則而編寫的,不是真實錄音的轉錄,因此顯得過於整齊。實際訪談會有重復、裝置調整和不確定的歸屬。

本文使用真實素材:Sausalito Historical Society 於 1985 年 1 月 5 日採訪 Sally Stapp,當年她將滿 80 歲。錄音以公有領域方式提供。我們將 A 面前五分鐘開啓講者辨識後處理,先展示未經編輯的輸出。

真實訪談轉錄示例

先聽 36 秒片段。演示文字對應系統輸出,可逐行對照。錄音與引用保留英文原文,便於核驗,而不是將譯文誤當成原話。

聽訪談,對照轉錄
公有領域口述歷史 · 0:36 · 未經編輯的轉錄
0:00 / 0:35
來源:“Oral Interview w. Sally Stapp”,Sausalito Historical Society,1985 年 1 月 5 日,經 California Revealed 與 Internet Archive(casauhs_000095)提供,Public Domain Mark 1.0,無使用限制。取前 36 秒,重新編碼為 128 kbps 立體聲網頁音訊。文字為該檔案未經編輯的輸出,因此保留錄音中的“when you when you came to Sausalito”重復。片段由 V2 後端處理,行與詞的時間來自實際對齊,不是插值。音訊及轉錄保留英文原文,便於核對。

原始結果如下:

```

[00:02] SPEAKER_01: Now it's working.

[00:04] SPEAKER_01: Now it's working.

[00:05] SPEAKER_01: This is Sally Stapp and it is January 5th, 1985.

[00:10] SPEAKER_00: I don't know how to run this any better than I know.

[00:12] SPEAKER_01: Okay.

[00:13] SPEAKER_01: Sally, first thing I want to ask is when you when you came to Sausalito?

[00:18] SPEAKER_00: Right after World War II.

[00:20] SPEAKER_01: Where had you been before?

[00:23] SPEAKER_00: Naval Air Station, San Diego, for the duration.

[00:29] SPEAKER_01: Where are you from?

[00:31] SPEAKER_00: I was born in Cleveland, Ohio.

[00:32] SPEAKER_01: Cleveland, Ohio.

[00:33] SPEAKER_00: April 30th, 1905.

```

這十三行中有四個值得注意的細節。

“Now it's working”確實說了兩次。 這不是應自動刪掉的重復錯誤:錄音里有人剛調好裝置,重復確認它能用了。真實訪談未必從正式問題開始。

系統給出編號,不是真實姓名。 `SPEAKER_00`、`SPEAKER_01` 表示偵測到的不同聲音,系統並不知道誰是 Sally。需要人來核對並統一改名。

“when you when you”也是實際重復。 訪談者重新起句。完整逐字稿應保留,整理稿可以按事先聲明的規則去掉一次。不能悄悄刪掉,卻仍把結果稱為完整逐字稿。

00:10 的發言歸屬需要核對。 “I don't know how to run this any better than I know”被分配給 `SPEAKER_00`,但內容也可能來自正在調整裝置的人。僅憑語義猜測不夠,應回聽確認;初始短發言和打斷處尤其容易分錯。

下面示範如何加上文件頭、身份說明和不確定性標記。為了展示格式,片段保留全部原始行,不擅自把被另一人打斷的兩句合成一次發言:

```

訪談逐字稿

專案:口述歷史專案,Sausalito Historical Society

日期:1985 年 1 月 5 日

地點:Sausalito,加利福尼亞州

參與者:Sally Stapp(1905 年 4 月 30 日出生)

訪談者:Sausalito Historical Society

錄音:A 面,31 分 36 秒;本示例為開頭片段

形式:保留原話的格式示例,待核對處已標註

來源:California Revealed/Internet Archive,公有領域

[00:02] 訪談者:Now it's working.

[00:04] 訪談者:Now it's working. [錄音中確有重復]

[00:05] 訪談者:This is Sally Stapp and it is January 5th, 1985.

[00:10] 未確認:I don't know how to run this any better than I know.

[講者歸屬待對照音訊核實]

[00:12] 訪談者:Okay.

[00:13] 訪談者:Sally, first thing I want to ask is when you when you came to Sausalito?

[00:18] STAPP:Right after World War II.

[00:20] 訪談者:Where had you been before?

[00:23] STAPP:Naval Air Station, San Diego, for the duration.

[00:29] 訪談者:Where are you from?

[00:31] STAPP:I was born in Cleveland, Ohio.

[00:32] 訪談者:Cleveland, Ohio.

[00:33] STAPP:April 30th, 1905.

```

變化在於說明和標記,而不是偷偷改寫原話。重復沒有被無聲刪除,不確定的發言也沒有強行分配給“看起來更可能”的人。

這就是為什麼訪談逐字稿不能簡單等同於工具剛生成的檔案。

逐字稿是什麼,又不是什麼?

逐字稿記錄說了什麼,以及先後順序,不是筆記、摘要或會議紀要。

  • 筆記記錄聽者認為重要的內容。
  • 摘要歸納談話的主要意思。
  • 逐字稿是前兩者可以回溯的文字依據。
  • 研究、新聞及需要核實事實的場景尤其應區分。如果轉錄與錄音不符,後續分析和引用也可能受影響。第一份記錄宜盡量忠實,再另作適合發佈或彙報的版本。

    三種轉錄形式

    選錯形式,可能浪費時間,也可能刪去研究所需的資訊。

    形式保留內容適用情況限制
    完整逐字稿詞句、猶豫、重啓、重復及必要停頓,標註笑聲、嘆氣等會話、話語分析,以及表達方式本身重要的工作製作和閱讀更費時
    整理逐字稿實質內容,按聲明規則去除非必要口頭語和中斷起句部分主題分析、採訪整理和Podcast文稿需要判斷哪些細節具有意義
    編輯稿核心內容,可刪去旁支和偏題部分出版、內部報告和案例介紹不再是完整記錄,不應只保留這一份

    開始前選定,並在文件頭寫明。 否則讀者無法判斷某段流暢表達來自原話,還是後期刪掉了猶豫。

    實際有多少口頭語?

    原文對 934 段英語雙人錄音的系統逐字稿統計了幾種表達:

    英文表達每千詞平均次數4,620 詞訪談的近似次數
    um2.16約 10
    uh0.92約 4
    you know5.20約 24
    like17.40約 80

    有幾個限制:like 的次數包含普通語義用法,不全是口頭語;平均數不能代表每個人;自動轉錄可能漏掉短回應,因此也不是對所有實際發聲的完整計數。更不能將這些英語頻率當成中文“嗯”“那個”的統計。

    即使去掉約四十次前三類表達,也不會讓四千多詞的文件驟然變短。選擇整理稿的理由應是分析不需要這些細節,而不是單純節省篇幅。可能有意義的猶豫,應保留在主記錄中。

    訪談逐字稿的三個組成部分

    讓未來的讀者知道材料從何而來、怎樣處理過:

    ```

    專案:[研究或專案名稱]

    日期:[訪談日期]

    地點:[地點,或“遠程 — Zoom”]

    參與者:[姓名/化名及必要資訊]

    訪談者:[姓名或代號]

    錄音:[檔案名與總時長]

    形式:[完整逐字稿/整理逐字稿/編輯稿]

    匿名化:[是/否]

    同意記錄:[已簽署檔案或授權記錄的引用]

    ```

    最容易漏掉的是形式和匿名化。缺少前者,不知道文字為何流暢;缺少後者,半年後可能分不清“王女士”是真實身份還是化名。

    2. 正文

    1. 每段只放一個人的發言。 即使回答只有一個詞,也不要與提問者混在一起。

    2. 標籤一致,後接冒號。 例如 `訪談者:`、`P1:`,不要中途更換寫法,便於分析軟體辨識。

    3. 時間戳記以便於回聽為準。 短訪談可在換人時標記,長訪談可每 30–60 秒標記,不必機械地每三秒插一次。

    4. 非語言資訊放在方括號中。 例如 `[笑聲]`、`[停頓]`、`[電話鈴聲]`、`[重疊發言]`、`[聽不清 00:14:22]`。

    5. 標出不確定,而不是裝作確定。 `[存疑:Kessler?]` 比無提示寫入一個錯誤姓名更有用。

    3. 研究用行號

    要精確引用時,可加入穩定行號,例如“P4,第 212–218 行”。最好在最終校對後生成;文字仍頻繁變動時不斷重排行號,可能使已有引用指向錯誤位置。

    發言分布對排版有什麼啓示?

    原文統計 1,248 段至少五分鐘的雙人錄音,時長中位數為 29.9 分鐘。其中 1,030 段可統計每人發言時長,較多發言者的佔比中位數為 72.4%,第 90 百分位為 88.7%。

    這提示兩點,但樣本並不等於全部經過人工確認的研究訪談。

    段落長度不均勻是正常的。 訪談參與者可能說得遠多於提問者。本文五分鐘口述歷史樣本中,參與者佔 85.8%,訪談者佔 14.2%。如果另一段錄音接近各一半,也可能反映真實交談方式,而不是排版錯誤。

    系統片段很多,不等於每段都要獨立成段。 原文樣本的片段數中位數為 391。應按換人和自然語義組織段落,避免一頁不換段,也不要把算法每次切分都機械當成新發言。

    人工聽打的工作流程

    1. 按需要將播放速度調至約 75%。 使用有鍵盤快捷鍵的播放器,比不斷追趕正常語速更容易保持節奏。

    2. 設定回退五秒的快捷鍵或腳踏控制。 減少反復移動滑鼠。

    3. 第一遍記錄內容。 不因查名字或格式化而頻繁打斷;不清楚處標 `[?]`。

    4. 第二遍處理疑點。 對照錄音查姓名、數字和術語,必要時使用獲准的輔助資料。

    5. 最後統一格式。 加文件頭、標籤、時間戳記和穩定行號。

    完整人工逐字稿常按每小時音訊需要四至六小時規劃。約半小時訪談可能需要兩至三小時;實際取決於錄音、語言和標準,並非固定工時。

    自動轉錄把時間花在哪裡?

    自動轉錄不是免去人工,而是把工作從逐字輸入轉移到核對。

    原文中 962 段已完成雙人錄音的端到端耗時中位數為 5.5 分鐘,90% 在 45.5 分鐘內完成。另報告約 6.5 倍即時速度,它是獨立匯總指標,不應直接用其他兩個中位數相除得到。上傳大影片、網路、隊列及處理選項都可能影響慢任務。

    得到文字後仍要為校對留時間,不能把系統處理時間當成交付完整逐字稿的總時間。

    實際流程:

    1. 上傳錄音,在支援時開啓講者辨識。

    2. 核對並統一替換“講者 1”“講者 2”等標籤。

    3. 對照音訊修正姓名、數字、術語和重疊片段。

    4. 按預先約定的形式保留或整理口頭語,並保留主記錄。

    5. 匯出 DOCX 用於編輯、TXT 用於分析,或 PDF 用於固定版式存檔。

    定性研究中的訪談轉錄

    匿名化要一致。 不僅替換參與者姓名,還要檢查單位、同事、機構及可辨識地點。身份對應表另存並限制訪問,在文件頭說明已匿名化。不能第一頁用了化名,第九段卻保留真實雇主。

    完整保留問題。 回答常依賴問題的具體措辭;誘導性提問只有保留原話才能被發現。原文雙人樣本中較少發言者約佔 28% 的中位發言時間,但這不證明每段較少發言者都是訪談者。無論比例多少,問題都具有解釋價值。

    編碼分析前統一轉錄規則。 在一組訪談中途從完整逐字稿改為整理稿,可能把編輯差異誤當成人的表達差異。

    確認分析軟體的匯入方式。 ATLAS.ti、NVivo、MAXQDA 等工具可使用 DOCX 或純文字,但標籤和格式約定需按具體版本檢查。保留 TXT 主副本有助於減少格式依賴。

    常見錯誤

  • 兩個人合在同一段:影響引用與自動分析。
  • 刪除重復卻稱為完整逐字稿:形式說明與內容不符。
  • 每行都加時間:可能幹擾閱讀,應按用途決定密度。
  • 猜測聽不清的詞而不標記:錯誤可能進入正式引用。
  • 使用通信應用程式壓縮過的副本:有原檔案時應優先使用原檔案。
  • 最終文件仍留未核對的通用講者標籤:應明確身份或保留“未確認”,不要隨意分配。
  • 沒有文件頭:以後難以確定來源和處理規則。
  • 用自己的訪談測試

    原文五分鐘示例開啓講者辨識後,記錄的處理耗時約 80 秒。您可免註冊試轉錄自己的前五分鐘,評估真實材料,而不只是選好的演示;具體試用功能以頁面提供的選項為準。

    上傳音訊或影片,確認語言,核對文字與標籤,再選匯出格式。講者、完整轉錄和 DOCX、PDF、SRT、VTT 等權限依方案提供。

    更多素材見三個可聽轉錄示例。影片訪談見 MP4 轉錄指南;錄製與校對方法見訪談轉錄技巧。

    ---

    *素材:“Oral Interview w. Sally Stapp”,Sausalito Historical Society,1985 年 1 月 5 日,經 California Revealed 與 Internet Archive(casauhs_000095)提供,Public Domain Mark 1.0。2026 年 8 月 2 日處理 A 面前五分鐘,開啓講者辨識。第一份示例為未經編輯的輸出。匯總資料來自 TranscribeNext 生產記錄,時間為 2025 年 10 月 9 日至 2026 年 7 月 31 日。*

    準備好轉錄你的音訊了嗎?

    免費體驗 TranscribeNext 的 AI 轉錄

    免費開始使用,無需信用卡

    © 2026 TranscribeNext.com. 保留所有權利。

    訪談轉錄如何排版:格式規範與真實錄音示例 | TranscribeNext