本文原始版本描述了一次實驗:將同一段 60 分鐘錄音交給九項服務,包括三項 AI、五項人工,以及一項自動辨識加人工校對的混合服務。
原文稱總支出為 US$4,237,逐詞比較用了 47 小時,但後面的訂單金額並不能解釋這一總額。本文也沒有附上參考檔案、收據或完整可復現方法。因此,下文是對源文所報告資料的介紹,不是本次重新驗證的測試,也不是供應商目前排名。
值得討論的問題依然成立:什麼情況下哪種方式更合適?哪些錯誤真正影響使用?
測試錄音是英語,不能直接推斷中文或其他語言的效果。德語語音辨識對比提供另一種語言的資料視角,該參考頁面為英文。
選擇不僅關乎百分比或交付速度,還取決於文字用途,以及校對所需的實際工作量。
- AI 通常能以較低成本更快生成初稿。
- 專業術語、口音和重疊發言尤其需要人工核對。
- 低風險用途可先試 AI,並記錄糾錯時間。
- 最佳方案取決於錄音、期限以及錯誤的後果。
- 1. 原文所述實驗:九項服務,同一錄音
- 2. AI 的優勢:速度、費用與計畫安排
- 3. 人工校對的價值:語境、口音與格式
- 4. 如何理解“99% 準確率”
- 5. 錯誤嚴重程度
- 6. 選擇標準
- 7. 包含校對時間的總成本
- 8. 混合工作流程
- 9. 原文案例及局限
- 10. 如何作出選擇
原文如何描述實驗?
單人在錄音棚清晰講話,未必能揭示不同方法的局限。原文選擇了更難的醫學會議討論:四位醫生用帶美國、英國、印度和尼日利亞口音的英語發言,包含醫學術語、觀眾噪聲與問答中的重疊聲音。
檔案為 60 分鐘、128 kbps 的 MP3。AI 服務列為 TranscribeNext、Otter.ai Plus 和 Rev AI;其現價取決於方案與計費方式,不能從這份歷史記錄推斷。
原文列出的人工訂單金額是 Rev Human US$90、GoTranscript US$72、TranscribeMe US$99、Scribie US$60、Upwork 自由職業者 US$120;混合服務 Verbit 為 US$180。這些均為源文報告值,不是目前報價。
原文報告的結果
作者稱進行了逐詞比較並分類錯誤。以下保留同一小時錄音的報告數字。
歷史記錄中的數字
| 服務 | 報告準確率 | 錯誤數 | 主要問題 | 交付耗時 |
|---|---|---|---|---|
| TranscribeNext,AI | 91.2% | 879 | 主要為醫學術語 | 8 分鐘 |
| Otter.ai,AI | 87.4% | 1,260 | 口音與術語 | 10 分鐘 |
| Rev AI | 89.7% | 1,030 | 醫學術語 | 12 分鐘 |
| Rev Human | 98.3% | 170 | 主要為標點細節 | 18 小時 |
| GoTranscript | 97.1% | 290 | 部分醫學術語 | 22 小時 |
| TranscribeMe | 98.7% | 130 | 少見術語 | 36 小時 |
| Scribie | 96.8% | 320 | 講者標籤不一致 | 28 小時 |
| Upwork 自由職業者 | 99.1% | 90 | 錯誤較少 | 15 小時 |
| Verbit,混合 | 99.4% | 60 | 該記錄中總數最低 | 6 小時 |
一個百分比隱藏了什麼?
91.2% 看起來可能夠用,但在約一萬詞的文字中,879 處錯誤相當於約每 11 個詞出現一處。
原文舉例把“atrial fibrillation”寫成“aerial fibrillation”,還報告 23 處講者歸屬錯誤。保留英文是因為錯誤依賴原語言的聲音與拼寫;前者指心房顫動,後者不是正確醫學術語。
Rev Human 的 170 處錯誤則被描述為主要涉及逗號和猶豫,沒有關鍵醫學術語或講者標籤錯誤。這樣的區別,比單純比較 91% 與 98% 更影響用途。
但方法存在局限:源文混合統計詞、標點和講者錯誤,沒有統一指標定義。這些百分比不能直接等同於標準詞錯誤率 WER,也不能與其他基準橫向比較。
不能忽略語言
上表來自英語錄音,對中文、泰米爾語等語言的表現說明很有限。
“支援 100 多種語言”不代表每種語言同樣準確。源文曾描述按資料與表現將語言分成 15、25、30、30 個的四組,但這種分組本身並非評測證據。
訓練資料、口音、麥克風和主題都可能影響結果。接受一個準確率數字前,先問語言與測試條件,再用自己的錄音驗證。
什麼情況下 AI 更合適?
速度
表格給 TranscribeNext 記為八分鐘,源文另一處又寫包括上傳下載共十一分鐘,計時邊界未完全說明。因此穩妥的結論是“以分鐘計”,不是固定八分鐘保證。
原文最快人工交付約十五小時。下午兩點採訪、五點交稿的記者,可能更需要當天即可檢索的自動初稿,但用於報道的引語仍應對照音訊核實。
費用
源文給出的歷史平均值是 AI 每音訊小時 US$11.33,人工 US$88.20,相差約 7.8 倍。按相同假設處理一百小時,是 US$1,133 與 US$8,820,尚未計校對。
這不是 TranscribeNext 目前單價。我們的方案有不同限制,不能直接換算為統一按小時收費。比較時應使用實際使用量,並計入訂閱、分鐘費和糾錯工時。
可預測性
源文另提 AI 結果在 87%–93%、人工在 89%–99.5% 之間,卻未詳述樣本。這提醒我們考慮穩定性,但不能證明某一類別永遠更穩定。
相似檔案的自動流程可能更便於計畫;人工交付也取決於專業程度、質控和人員安排。應比較具體服務條件,而不只是“AI”或“人工”的標籤。
人工校對在哪些地方更有價值?
語境與專業術語
原文中的“We saw a significant increase in PD patients”被部分自動輸出寫成“pee-dee patients”或“PD patience”,據稱只有一項 AI 保留了正確縮寫。
五位人工轉錄者被描述為記錄正確,其中三位加註“[PD = Parkinson's Disease]”。這類解釋指向帕金森病,但必須明確是編輯注釋,不能偽裝成講者的原話。
另一句“The patient was given two liters of NS”出現了“two leaders of N S”或“two liters of N's”等錯誤。原文稱人工辨識了生理鹽水的語境,並有時解釋縮寫。
合格校對的價值在於回聽、查證和判斷語境,但人也可能過度推斷。無法確認的縮寫應標記疑問,而不是只因某種解釋合理就確定寫入。
口音
原文稱尼日利亞醫生每分鐘約 180 詞,其片段中 TranscribeNext 為 79%、Otter 為 72%,最佳人工結果約 98%。
示例原句是“The prophylactic antibiotic regimen reduced postoperative infections”,錯誤輸出包括“The profile active antibiotic region reduced post operative infections”和“The profile at it can to buy out a regimen reduce postoperative infections”。
本文未附完整參考音訊以核驗這些行。實際啓示是:測試自己會遇到的口音,並給困難片段留校對時間,不要外推錄音棚演示的平均值。
重疊發言
兩人同時講話時,原文給出混在一起的輸出:“Yes I think that the answer to your absolutely question is we need to consider that more research”。
更謹慎的處理是標註 `[重疊發言]`、保留能聽清的部分並注明時間。承認無法分辨,比拼出一句沒人真正說過的流暢文字更可靠。
格式
源文用無標點初稿舉例:
```
speaker one okay so the main thing we need to discuss is um you know the the protocol changes and uh speaker two yeah absolutely i mean uh we saw some really interesting results...
```
並對比整理後的版本:
```
Dr. Sarah Chen: The main thing we need to discuss is the protocol changes.
Dr. James Wilson: Absolutely. We saw some really interesting results in the Phase II trial, especially with the dosing schedule.
```
示例保留英文以展示原文比較。整理口頭語、加名字和段落有助閱讀,但不能憑空補入錄音中沒有的二期試驗或給藥細節。上面第二版中的新增細節是否有錄音依據,必須另行核實。
現代自動工具也能加標點和區分講者,因此不能將全部 AI 輸出描述為一串無格式文字。關鍵是自己的檔案還需要多少人工工作。
如何理解“最高 99% 準確率”?
“最高”說明某些條件下可能達到,不是任意檔案的保證。可查看 Rev 的準確性說明及各家的評測條件。
清晰、低噪聲、常見詞彙,與四種口音的醫學討論不同。也不能反過來僅憑免責聲明,就斷言供應商只在實驗室里成功過一次。
如果錯誤定義相同,一萬詞中 99% 約意味著一百處錯誤,91% 約意味著九百處,校對負擔可能差很多。人工服務的品質保證也有條件,應直接核對,不把一個 98.3% 的歷史樣本當成普遍保證。
錯誤的後果並不相同
總體錯誤率不能獨自說明風險,應按後果分類。
改變意思:例如把“穩定”變成“不穩定”、“陽性”變成“陰性”。原文報告 AI 每萬詞約八十處、人工兩處,但未提供標註清單可審計;這一類別的重要性並不依賴該數字。
損害可信度:姓名、職務和術語錯誤。原文稱 AI 高二十倍,仍缺少可復核資料。
影響理解:標點和講者歸屬錯誤,原文稱自動組高九倍。
版式或風格:猶豫和格式不一致,原文稱高 2.5 倍。但在會話分析中,猶豫可能是資料,而非應消除的錯誤。
源文另列嚴重錯誤率 3% 與 0.12%,兩者相除是 25,不是 24。缺少清晰定義時,這一倍數也不應推廣為通用結論。
保留一個“嗯”和把“建議治療”寫成“不建議治療”,是完全不同的影響。校對強度應與後果相匹配。
如何選擇?
可以先考慮 AI 的情況
需要快速初稿、檔案量大、錄音較清楚、預算有限,並且有人能核對結果。比如記者先檢索採訪、Podcast生成文字底稿,或研究者開始整理訪談。
按真實使用量、語言和匯出需求比較方案,並在不同工具上測試同一個片段。
應考慮專業人工轉錄或復核的情況
錯誤可能影響重要決定、音訊很難聽清、術語專業,或交付有正式要求。
證言、臨床檔案和程序性材料可能要求特定資質與流程。普通人工校對不自動等於認證、法律適用或專業合規。源文歷史價格為每分鐘 US$1.50–4,不能替代目前詢價;還需確認語言、期限、質控和保密範圍。
適合混合流程的情況
既希望迅速得到初稿,又需要嚴格復核;或大部分錄音清楚,少數片段困難。
AI 先生成文字,再由人對照錄音修正並標記疑點。是否比從零聽打便宜,取決於初稿品質和審查深度。Verbit 等服務提供混合方式,也可以使用 TranscribeNext 後另聘校對。價格與範圍應直接確認。
把自己的時間算進去
用明確假設計算一小時音訊:
AI:分攤服務費 US$9,加 45 分鐘校對。若您的工時值 US$50/小時,校對成本 US$37.50,總計 US$46.50。
人工服務:服務費 US$90,加 15 分鐘復核,即 US$12.50,總計 US$102.50。
差額為每音訊小時 US$56,一百小時為 US$5,600,前提是上述假設全部不變。
若工時值 US$100/小時,兩者分別為 US$84 與 US$115,差額縮小為 US$31。
該例的盈虧平衡點是 US$162/小時:`9 + 0.75 × 工時單價 = 90 + 0.25 × 工時單價`。原始版本寫 US$108,與自身前提不符。
US$9 不是 TranscribeNext 的固定費率。 請替換為方案實際分攤、真實校對時間和人工報價。對部分專業人士,委託校對可能比親自完成更經濟。
實用混合流程
原文的“90% AI、10% 專業復核”模式
作者描述多數工作先用 AI,敏感材料交給專業人員。建議流程為:
1. 在獲得相應處理授權後上傳音訊。
2. 閱讀初稿並標記疑點。
3. 回聽引語、數字、姓名和關鍵內容。
4. 修正文字與講者。
5. 將高風險材料交給有相應能力和權限的專業人員復核。
源文稱許多檔案約需三十分鐘校對,但個人筆記與出版、研究或正式檔案的標準不同,不能統一套用。
其一百小時/月示例為混合模式 US$1,700、全人工 US$9,000,按這些假設一年差 US$87,600。這是示例計算,不是報價,也不保證達到 99% 準確率。
原文案例與應保留的疑問
原文提到三家未提供足夠獨立核驗資料的組織。這些場景有助思考工作流程,不應拿來預測自己的收益。
律師事務所:原文稱每年超過五百小時,費用從 US$750,000 降至 US$150,000,正式提交材料仍由人工復核。這些金額遠高於前面的小時費率,卻沒有解釋服務範圍。不能在不瞭解要求的情況下比較;即使不提交法院,檔案也可能需要嚴格校對。
醫學研究者:兩百次訪談,原文稱原預算 US$36,000、六個月,改用 AI 並自行核對術語後少於 US$5,000、兩周。實際是否合適還取決於同意、保密、研究方案與內容核驗,而非費用一個指標。
Podcast網路:每月八十期,原文將人工 US$9,000 與 AI US$3,600 對比,並提到自然流量增長 340%。沒有資料隔離轉錄的作用,不能認為使用轉錄即可獲得相同增長。
為自己的用途作決定
使用接近日常工作的錄音,檢查錯誤並計時校對。低風險初稿可以先用 AI;敏感或正式材料應從一開始就規劃適當的復核。
真正的問題不是“AI 還是人”,而是“這個用途需要什麼準確性與復核流程”。個人筆記、研究初稿、Podcast文稿或會議記錄都可從 AI 開始,但校對標準應與用途匹配。
法律、醫療及以您名義發佈的內容需要更謹慎。專業人員同樣可能出錯,因此要確認資質、範圍和交付標準。大批量工作可讓自動化承擔適合的部分,把人的注意力集中在最需要判斷的地方。
五個快速問題
這些答案比一個孤立的準確率更有用。
AI 與人工轉錄常見問題
AI 與人工一樣準確嗎?
取決於語言、錄音和復核。源文個案中的最佳 AI 為 91.2%、人工 99.1%、混合 99.4%,但沒有完整審計材料,不能推廣。
什麼時候 AI 足夠?
需要較清晰錄音的初稿,並能核對重要資訊時。會議、訪談、Podcast和日常材料都可能受益,容錯程度仍由用途決定。
什麼時候應找專業人員?
錯誤會影響人、決定或義務時,例如正式程序、臨床檔案或合規記錄。應確認服務符合具體要求,聘人本身不等於免除質控。
混合方式怎樣工作?
AI 生成初稿,人對照錄音核對、修正和標記疑點。可由同一服務提供,也可分別採購。節省多少取決於初稿品質。
人工貴多少?
源文歷史平均為 US$11.33 與 US$88.20/音訊小時,約 7.8 倍,不代表現價。實際要計入方案、量、期限及校對成本。
---
相關指南:
---
*想先測試?TranscribeNext提供前五分鐘免費預覽,Free 帳號每天最多三個檔案。請使用自己的錄音並核對結果是否滿足用途。*