TranscribeNextTranscribeNext.com
Blog指南

音訊轉文字示例:聽一聽 3 段真實錄音(2026)

📝

TranscribeNext 團隊

閱讀約需 12 分鐘
轉錄示例轉錄示例音訊轉文字講者標籤逐字稿

音訊轉文字示例展示的是口語如何呈現為書面記錄:左側是時間戳記,每次發言單獨成段,講者變化時標註身份。 兩種常見形式是去除口頭語的整理逐字稿,以及保留每個“嗯”和中斷句的完整逐字稿。

Free

這些基本概念,各類指南的解釋大同小異。但很少有指南讓您直接聽到示例對應的原始錄音。

這一點比想象中更重要。錄音棚里清晰錄製的一段獨白,與四個人圍著桌子、共用桌中央一個麥克風的討論,轉錄結果會很不一樣。也許只有其中一種接近您的實際檔案。因此,我們選取了三段真實錄音:會議、訪談和語音留言。每段都附有系統生成的逐字稿,並隨播放逐詞高亮。沒有重新錄入,也沒有人工修正。

會議樣本所屬的語料庫還提供了人工參考轉錄,因此本文最後會將系統結果與之對照,給出具體錯誤率。錄音及對應轉錄保留英文原文,便於逐句核對;它們不是未翻譯的界面內容。

示例 1:三人會議,麥克風離講者較遠

點選播放。高亮會跟隨目前說出的單詞,講者變化時標籤也隨之變化。

聽真實會議,對照轉錄
AMI 語料庫 · 單個遠距離麥克風 · 3 位講者 · 0:48
0:00 / 0:48
來源:AMI Meeting Corpus 的 EN2002a 會議(CC BY 4.0),由桌子中央的單個麥克風錄製。該片段體現了真實使用中較難的錄音條件。轉錄和講者標籤均為未經編輯的系統輸出:163 個詞、10 個片段、辨識出 2 個聲音;人工參考為 208 個詞、20 次發言、3 個聲音。該片段詞錯誤率為 30.8%。行與詞的時間均來自實際對齊結果,不是插值。音訊及對應轉錄保留英文原文,便於核對。

我們特意選擇了一個較難的場景。麥克風不是夾在某個人衣領上,而是放在桌子中央,遠距離收錄所有人的聲音,同時也收進房間里的回聲。三個人交談,時而互相打斷。

請留意以下現象,它們能說明真實會議轉錄會出現什麼問題:

  • 一句話被重復記錄。 0:19 的“So did you have to write it in the way that they wrote it, is that what you did?”之後,0:21 又單獨出現了“Is that what you did?”。實際上沒有人重復說這句話。聲音重疊可能導致這種重復轉錄。
  • 重疊發言變成了依次發言。 人工參考文字中,第二個人常常在第一個人尚未說完時就開始講話。系統轉錄則將片段依次列出,以便在單列文字中閱讀。原本同時發生的發言,看起來變成了先後發生。
  • 簡短回應被漏掉。 在這 48 秒的人工參考文字中,三個人說過“okay”“right”“okeydoke”和“mm-hmm”等回應。系統結果中大部分沒有出現。
  • 最後一點是自動轉錄在遠距離錄音中的真實局限。下文的準確性分析會給出具體數量。

    示例 2:麥克風靠近講者的訪談

    聽訪談,對照轉錄
    公有領域口述歷史 · 0:36 · 未經編輯的轉錄
    0:00 / 0:35
    來源:“Oral Interview w. Sally Stapp”,Sausalito Historical Society,1985 年 1 月 5 日,經 California Revealed 與 Internet Archive(casauhs_000095)提供,Public Domain Mark 1.0,無使用限制。取前 36 秒,重新編碼為 128 kbps 立體聲網頁音訊。文字為該檔案未經編輯的輸出,因此保留錄音中的“when you when you came to Sausalito”重復。片段由 V2 後端處理,行與詞的時間來自實際對齊,不是插值。音訊及轉錄保留英文原文,便於核對。

    使用的是同一套系統,閱讀體驗卻完全不同。每次只有一個人發言,麥克風距離較近,也沒有聲音重疊。句子完整,標點與停頓相符,不需要費力辨別交疊的發言。

    與上一段會議對比,最有用的結論是:錄音條件決定轉錄品質。 領夾麥克風或耳麥帶來的改善,往往比調整軟體參數更明顯。

    示例 3:一位講者,十六秒的語音留言

    聽真實語音留言,對照轉錄
    CC0 錄音 · 重新編碼為電話音質 · 0:16
    0:00 / 0:15
    來源:Sample_Me 的“Woman Leaving a Phone Message”(Freesound,CC0 1.0)。音訊經 μ-law 編碼轉為單聲道 8 kHz,以模擬電話留言音質,而非錄音棚條件。文字是該檔案未經編輯的系統輸出。行時間來自片段時間戳記;逐詞高亮在每行內插值計算。音訊及對應轉錄保留英文原文,便於核對。

    單人短錄音是相對簡單的情況,也展示了最基礎的轉錄形式:只有一個聲音,不需要反復標註講者;時間戳記出現在每組句子的開頭。

    日常的語音備忘錄、課堂錄音或口述筆記,通常就是這樣呈現的:一列時間,一列文字。

    整理逐字稿與完整逐字稿

    兩種形式對應同一段錄音,區別在於刪去了什麼。

    完整逐字稿保留講者的全部表達,包括本人未必希望被引用的部分。以下示例保留錄音中的英文:

    ```

    0:08 I had to figure out how to how to do the same thing for the

    summary, that's how I see it.

    ```

    “how to how to”的重復不是轉錄錯誤,而是講者確實重復了這些詞。

    整理逐字稿會去掉重復、口頭語和未說完的起句,不改變其餘意思:

    ```

    0:08 I had to figure out how to do the same thing for the summary.

    ```

    選擇哪一種,取決於文字的用途:

    | 用途 | 形式 | 原因 || --- | --- | --- || 定性研究、法律和醫療場景 | 完整逐字稿 | 猶豫和重復也可能是重要資訊 || 會議筆記、內部記錄 | 整理逐字稿 | 口語中的磕絆通常無助於閱讀 || 發佈、字幕和營銷 | 整理逐字稿,再進行校對 | 優先保證可讀性 || 語言與語音研究 | 完整逐字稿,加上非語言標記 | 包括 `[停頓]`、`[笑聲]`、`[聽不清]` |

    實用做法是先保留完整逐字稿,再整理一份副本。從完整版本整理出精簡版本通常只需幾分鐘;反過來補回被刪掉的細節,就得重新聽錄音。

    多人轉錄的格式

    不止一人發言時,轉錄需要說明是誰在說話。通常每次發言單獨成段,將講者標籤放在左側或上方。下例保留英文原話:

    ```

    Speaker 1 So did you have to write it in the way that they wrote it,

    is that what you did?

    Speaker 2 Yeah, just search for specific string.

    Speaker 1 Fish the data, I was just thinking that, yeah.

    ```

    會議示例體現了三條實用規則:

    1. 不要把兩個人的發言合在同一段。 一段裡混入兩個聲音,會增加引用、研究編碼和查找的難度。

    2. 換人時標註,不必每行都標。 連續六行都寫“講者 1”,反而干擾閱讀。

    3. 最後統一替換姓名。 自動系統使用 `Speaker 1`、`Speaker 2` 等通用標籤。校對完文字後,再替換為真實姓名即可。

    影片轉錄是什麼樣的

    影片轉錄依據的是音軌,畫面內容不會自動補充到逐字稿中。主要區別在於時間戳記的後續用途:

  • 逐字稿:在自然停頓處標註時間,方便閱讀和查找。
  • SRT/VTT 字幕:將同樣的文字切成帶起止時間的字幕塊,通常每塊顯示約 1 至 7 秒,並調整長度以適合螢幕上的兩行文字。
  • 同一份錄音可以生成兩種結果。匯出 SRT 是格式轉換,而不是重新轉錄。如果需要字幕,先完成轉錄,再調整字幕塊的切分與時長。

    很少被公開的準確性資料

    許多示例頁面到了準確性問題上就不夠具體。原文調查時,SpeakWrite 宣稱“99%–100% 準確率”,TranscribeMe 宣稱“99%+”,但所引用的頁面沒有同時提供對應音訊和評測用參考轉錄。缺少這些材料,就無法獨立核驗或直接比較這些百分比。

    上面的會議樣本可以核對,因為 AMI 語料庫提供了人工參考文字。下面是 48 秒片段的對照:

    | | 人工參考文字 | 系統轉錄 || --- | --- | --- || 詞數 | 208 | 163 || 發言次數/片段數 | 20 | 10 || 講者數 | 3 | 2 || “okay”“right”“mm-hmm”等簡短回應 | 7 | 2 |

    該片段的詞錯誤率為 30.8%:41 處替換、17 處遺漏和 6 處插入。

    整段 35 分鐘的會議中,有 17 個可比較的 45 秒視窗。這些視窗的詞錯誤率中位數為 36.8%,表現最好的視窗為 15.5%。

    這些數字能說明三件事,但不能推匯出第四件事。

    它說明遠距離會議錄音難以轉錄。 麥克風放在桌子中央,三個人輪流或同時發言,是實際使用中相當困難的場景。因此,結果與“99%”相距甚遠。

    它說明錯誤集中在哪裡。 房間里有三個聲音,系統卻只區分出兩個。第三個人幾乎不說完整句子,只用“okay”“yeah”和“mm-hmm”回應。該片段的七次簡短回應中,有五次完全被漏掉。錯誤並非均勻分布,而是集中在短發言和較輕的聲音上。

    它提示應該優先改進什麼。 對這類錄音,不能指望只調一個軟體參數就消除約 30% 的錯誤。給每個人配一個麥克風,可能更有幫助。

    它不能預測您自己的檔案會得到什麼結果。 聽聽第二個訪談示例:同一套系統,在麥克風靠近講者時,逐字稿就流暢得多。會議示例是有意選取的高難度測試,不能代表所有檔案。

    如何轉錄自己的錄音

    1. 讓麥克風盡量靠近嘴部。 一隻價格適中的領夾麥克風,可能比反復調整軟體設定更有效。

    2. 知道錄音語言時就手動指定,避免僅憑開頭幾秒自動判斷。

    3. 多人發言時,在開始轉錄前開啓講者辨識。

    4. 先確定交付文字的形式:需要保留猶豫和重復時,按完整逐字稿核對;不需要時,再整理副本。自動轉錄並不保證保留每個口頭語。

    5. 對照音訊核對第一分鐘。 姓名、專業術語和縮寫容易出錯,尤其值得人工檢查。

    您可以直接將音訊轉為文字,或將 MP4 轉為逐字稿,保留講者辨識和時間戳記,需要字幕時再匯出 SRT。

    常見問題

    音訊逐字稿是什麼樣的?

    通常一列是時間戳記,另一列是文字;每次發言單獨成段,換人時顯示講者標籤。單人錄音可省略標籤,多人錄音則保留標籤。

    整理逐字稿與完整逐字稿有什麼區別?

    完整逐字稿保留所有說出的內容,包括猶豫、重復和未說完的起句。整理逐字稿去掉這些內容,不改變其餘意思。研究和法律工作通常更需要完整記錄;會議筆記往往不需要保留所有口語細節。

    自動轉錄有多準確?

    結果很大程度上取決於錄音條件。上面的遠距離會議錄音,相對於公開人工參考文字的詞錯誤率為 30.8%。像訪談這樣近距離錄製的語音,文字更清楚,但姓名和專業術語仍可能出錯。沒有評測音訊支撐的單一準確率數字,不宜直接當作效果保證。

    轉錄會包含講者的真實姓名嗎?

    自動系統使用 `Speaker 1`、`Speaker 2` 等通用標籤,因為僅憑聲音無法知道每個人的身份。替換真實姓名需要人工完成,適合放在校對的最後一步。

    可以轉錄影片嗎?

    可以。系統使用影片中的音軌,因此流程與音訊轉錄相同。同一份結果也可以匯出為字幕。

    準備好轉錄你的音訊了嗎?

    免費體驗 TranscribeNext 的 AI 轉錄

    免費開始使用,無需信用卡

    © 2026 TranscribeNext.com. 保留所有權利。

    音訊轉文字示例:3 段真實錄音與轉錄結果(2026) | TranscribeNext