音訊轉文字示例展示的是口語如何呈現為書面記錄:左側是時間戳記,每次發言單獨成段,講者變化時標註身份。 兩種常見形式是去除口頭語的整理逐字稿,以及保留每個“嗯”和中斷句的完整逐字稿。
這些基本概念,各類指南的解釋大同小異。但很少有指南讓您直接聽到示例對應的原始錄音。
這一點比想象中更重要。錄音棚里清晰錄製的一段獨白,與四個人圍著桌子、共用桌中央一個麥克風的討論,轉錄結果會很不一樣。也許只有其中一種接近您的實際檔案。因此,我們選取了三段真實錄音:會議、訪談和語音留言。每段都附有系統生成的逐字稿,並隨播放逐詞高亮。沒有重新錄入,也沒有人工修正。
會議樣本所屬的語料庫還提供了人工參考轉錄,因此本文最後會將系統結果與之對照,給出具體錯誤率。錄音及對應轉錄保留英文原文,便於逐句核對;它們不是未翻譯的界面內容。
示例 1:三人會議,麥克風離講者較遠
點選播放。高亮會跟隨目前說出的單詞,講者變化時標籤也隨之變化。
我們特意選擇了一個較難的場景。麥克風不是夾在某個人衣領上,而是放在桌子中央,遠距離收錄所有人的聲音,同時也收進房間里的回聲。三個人交談,時而互相打斷。
請留意以下現象,它們能說明真實會議轉錄會出現什麼問題:
最後一點是自動轉錄在遠距離錄音中的真實局限。下文的準確性分析會給出具體數量。
示例 2:麥克風靠近講者的訪談
使用的是同一套系統,閱讀體驗卻完全不同。每次只有一個人發言,麥克風距離較近,也沒有聲音重疊。句子完整,標點與停頓相符,不需要費力辨別交疊的發言。
與上一段會議對比,最有用的結論是:錄音條件決定轉錄品質。 領夾麥克風或耳麥帶來的改善,往往比調整軟體參數更明顯。
示例 3:一位講者,十六秒的語音留言
單人短錄音是相對簡單的情況,也展示了最基礎的轉錄形式:只有一個聲音,不需要反復標註講者;時間戳記出現在每組句子的開頭。
日常的語音備忘錄、課堂錄音或口述筆記,通常就是這樣呈現的:一列時間,一列文字。
整理逐字稿與完整逐字稿
兩種形式對應同一段錄音,區別在於刪去了什麼。
完整逐字稿保留講者的全部表達,包括本人未必希望被引用的部分。以下示例保留錄音中的英文:
```
0:08 I had to figure out how to how to do the same thing for the
summary, that's how I see it.
```
“how to how to”的重復不是轉錄錯誤,而是講者確實重復了這些詞。
整理逐字稿會去掉重復、口頭語和未說完的起句,不改變其餘意思:
```
0:08 I had to figure out how to do the same thing for the summary.
```
選擇哪一種,取決於文字的用途:
| 用途 | 形式 | 原因 || --- | --- | --- || 定性研究、法律和醫療場景 | 完整逐字稿 | 猶豫和重復也可能是重要資訊 || 會議筆記、內部記錄 | 整理逐字稿 | 口語中的磕絆通常無助於閱讀 || 發佈、字幕和營銷 | 整理逐字稿,再進行校對 | 優先保證可讀性 || 語言與語音研究 | 完整逐字稿,加上非語言標記 | 包括 `[停頓]`、`[笑聲]`、`[聽不清]` |實用做法是先保留完整逐字稿,再整理一份副本。從完整版本整理出精簡版本通常只需幾分鐘;反過來補回被刪掉的細節,就得重新聽錄音。
多人轉錄的格式
不止一人發言時,轉錄需要說明是誰在說話。通常每次發言單獨成段,將講者標籤放在左側或上方。下例保留英文原話:
```
Speaker 1 So did you have to write it in the way that they wrote it,
is that what you did?
Speaker 2 Yeah, just search for specific string.
Speaker 1 Fish the data, I was just thinking that, yeah.
```
會議示例體現了三條實用規則:
1. 不要把兩個人的發言合在同一段。 一段裡混入兩個聲音,會增加引用、研究編碼和查找的難度。
2. 換人時標註,不必每行都標。 連續六行都寫“講者 1”,反而干擾閱讀。
3. 最後統一替換姓名。 自動系統使用 `Speaker 1`、`Speaker 2` 等通用標籤。校對完文字後,再替換為真實姓名即可。
影片轉錄是什麼樣的
影片轉錄依據的是音軌,畫面內容不會自動補充到逐字稿中。主要區別在於時間戳記的後續用途:
同一份錄音可以生成兩種結果。匯出 SRT 是格式轉換,而不是重新轉錄。如果需要字幕,先完成轉錄,再調整字幕塊的切分與時長。
很少被公開的準確性資料
許多示例頁面到了準確性問題上就不夠具體。原文調查時,SpeakWrite 宣稱“99%–100% 準確率”,TranscribeMe 宣稱“99%+”,但所引用的頁面沒有同時提供對應音訊和評測用參考轉錄。缺少這些材料,就無法獨立核驗或直接比較這些百分比。
上面的會議樣本可以核對,因為 AMI 語料庫提供了人工參考文字。下面是 48 秒片段的對照:
| | 人工參考文字 | 系統轉錄 || --- | --- | --- || 詞數 | 208 | 163 || 發言次數/片段數 | 20 | 10 || 講者數 | 3 | 2 || “okay”“right”“mm-hmm”等簡短回應 | 7 | 2 |該片段的詞錯誤率為 30.8%:41 處替換、17 處遺漏和 6 處插入。
整段 35 分鐘的會議中,有 17 個可比較的 45 秒視窗。這些視窗的詞錯誤率中位數為 36.8%,表現最好的視窗為 15.5%。
這些數字能說明三件事,但不能推匯出第四件事。
它說明遠距離會議錄音難以轉錄。 麥克風放在桌子中央,三個人輪流或同時發言,是實際使用中相當困難的場景。因此,結果與“99%”相距甚遠。
它說明錯誤集中在哪裡。 房間里有三個聲音,系統卻只區分出兩個。第三個人幾乎不說完整句子,只用“okay”“yeah”和“mm-hmm”回應。該片段的七次簡短回應中,有五次完全被漏掉。錯誤並非均勻分布,而是集中在短發言和較輕的聲音上。
它提示應該優先改進什麼。 對這類錄音,不能指望只調一個軟體參數就消除約 30% 的錯誤。給每個人配一個麥克風,可能更有幫助。
它不能預測您自己的檔案會得到什麼結果。 聽聽第二個訪談示例:同一套系統,在麥克風靠近講者時,逐字稿就流暢得多。會議示例是有意選取的高難度測試,不能代表所有檔案。
如何轉錄自己的錄音
1. 讓麥克風盡量靠近嘴部。 一隻價格適中的領夾麥克風,可能比反復調整軟體設定更有效。
2. 知道錄音語言時就手動指定,避免僅憑開頭幾秒自動判斷。
3. 多人發言時,在開始轉錄前開啓講者辨識。
4. 先確定交付文字的形式:需要保留猶豫和重復時,按完整逐字稿核對;不需要時,再整理副本。自動轉錄並不保證保留每個口頭語。
5. 對照音訊核對第一分鐘。 姓名、專業術語和縮寫容易出錯,尤其值得人工檢查。
您可以直接將音訊轉為文字,或將 MP4 轉為逐字稿,保留講者辨識和時間戳記,需要字幕時再匯出 SRT。
常見問題
音訊逐字稿是什麼樣的?
通常一列是時間戳記,另一列是文字;每次發言單獨成段,換人時顯示講者標籤。單人錄音可省略標籤,多人錄音則保留標籤。
整理逐字稿與完整逐字稿有什麼區別?
完整逐字稿保留所有說出的內容,包括猶豫、重復和未說完的起句。整理逐字稿去掉這些內容,不改變其餘意思。研究和法律工作通常更需要完整記錄;會議筆記往往不需要保留所有口語細節。
自動轉錄有多準確?
結果很大程度上取決於錄音條件。上面的遠距離會議錄音,相對於公開人工參考文字的詞錯誤率為 30.8%。像訪談這樣近距離錄製的語音,文字更清楚,但姓名和專業術語仍可能出錯。沒有評測音訊支撐的單一準確率數字,不宜直接當作效果保證。
轉錄會包含講者的真實姓名嗎?
自動系統使用 `Speaker 1`、`Speaker 2` 等通用標籤,因為僅憑聲音無法知道每個人的身份。替換真實姓名需要人工完成,適合放在校對的最後一步。
可以轉錄影片嗎?
可以。系統使用影片中的音軌,因此流程與音訊轉錄相同。同一份結果也可以匯出為字幕。