🗣️
中階什麼是講者辨識
瞭解 TranscribeNext 如何區分錄音中的講者,並為發言新增標籤。
閱讀時間約 4 分鐘 TranscribeNext 團隊 更新日期:2025年1月15日
講者辨識會區分錄音中的不同聲音,並為各段發言新增“講者 1”“講者 2”等標籤。
實用秘訣
講者辨識適用於 Plus 和 Premium 方案。Free 使用者可升級後使用。
講者辨識解決什麼問題
它用於判斷“誰在什麼時候說了話”,透過音高、音色和說話模式等聲學特徵區分發言者。
處理後,文字會按發言者分段,例如:
- 講者 1: 大家好,歡迎收聽本期Podcast。
- 講者 2: 謝謝邀請!
- 講者 1: 我們直接開始吧……
如何開啓講者辨識
- 1上傳音訊檔案
- 2在上傳設定中切換到“自訂模式”
- 3勾選“辨識不同講者”
- 4選擇自動辨識人數,或填寫實際人數;可用範圍以界面為準
- 5點選“開始轉錄”

自動辨識與手動指定人數
自動辨識(推薦):
- AI 自動估計講者數
- 適合多數錄音
- 有時可能將同一人拆成多人,或將不同人合併
手動指定人數:
- 填寫錄音中實際的講者數
- 人數已知時,可為處理提供額外約束
- 適合訪談、圓桌討論等人員明確的場景
實用秘訣
不確定人數時,可選擇自動辨識。轉錄完成後仍可檢查並修正講者標籤。
講者辨識的原理
AI 會分析:
- 聲音特徵:音高、音調和音色
- 說話模式:語速、節奏和停頓
- 聲學特徵:頻率和能量等資訊
隨後將可能屬於同一人的片段歸為一組,並分配“講者 1”“講者 2”等標籤。
改善辨識效果的建議
- 獨立麥克風:條件允許時,讓每個人使用自己的麥克風
- 輪流發言:重疊語音會增加區分難度
- 清晰的人聲:聲音差異明顯時,通常更容易區分
- 保持錄音品質:音質較差會影響辨識
- 減少背景噪音:噪音會干擾聲音分析
查看講者標籤
開啓講者辨識並完成轉錄後:
- 1打開逐字稿
- 2進入“逐字稿”分頁
- 3查看“講者 1”“講者 2”等標籤
- 4不同講者的發言以不同顏色區分
- 5時間戳記顯示各段發言的位置

匯出講者標籤
文件匯出是否包含講者標籤,取決於格式和匯出偏好:
- TXT:開啓相應設定時,可包含講者標籤
- DOCX:可在文件中保留講者名稱
- PDF:可在排版後的文件中保留講者資訊
- SRT:按時間分段匯出字幕,不應假定會自動包含講者名稱
哪些情況容易辨識不准
- 聲音相似:兩個人的聲音可能被混淆
- 同時發言:重疊語音難以分離
- 音質較差:噪音大或錄音不清晰
- 參與者較多:講者數增加時,區分可能更困難
- 發言很短:快速交替的簡短回應不容易歸屬
重要
講者辨識並非百分之百準確。重要轉錄結果應核對每段發言的歸屬。
適用場景
- Podcast與訪談:分清誰說了什麼
- 會議紀要:將意見對應到發言者
- 焦點小組:整理不同參與者的回應
- 法律事務記錄:核對證人和律師等人的發言
- 圓桌討論:跟蹤多位參與者
- 客戶通話:區分客服和客戶
實用秘訣
線上會議可使用會議錄製功能;平台提供的參會者資訊有助於整理髮言,仍應核對最終歸屬。
標籤
講者講者辨識辨識Plus
相關文章
⏱️
帶時間戳記的轉錄:跳轉到錄音位置
透過文字分段的時間戳記定位錄音,搜尋文字後跳轉收聽,並按需匯出時間資訊。
🎬
SRT 時間戳記格式:詳解 hh:mm:ss,mmm
逐項瞭解 SubRip 時間戳記 hh:mm:ss,mmm --> hh:mm:ss,mmm 的含義、常見格式錯誤、它與 VTT 和 SBV 的區別,以及如何從 TranscribeNext 匯出 SRT。
📊
瞭解轉錄準確率
瞭解哪些因素會影響辨識效果,以及如何透過錄音和設定改善結果。
🔍
在逐字稿中搜尋
快速查找逐字稿中的詞語、短語或相關內容。
相關工具
- 支援的音訊與影片格式 — 包括 MP3、WAV、OGG、MP4、MPEG 等格式,以及各格式的限制與使用建議。
- Mac 轉錄應用程式 — 使用 Whisper 和 Parakeet 免費離線錄音與轉錄;離線處理時,檔案不會離開你的電腦。