🗣️
中阶什么是说话人识别
了解 TranscribeNext 如何区分录音中的说话人,并为发言添加标签。
阅读时间约 4 分钟 TranscribeNext 团队 更新日期:2025年1月15日
说话人识别会区分录音中的不同声音,并为各段发言添加“说话人 1”“说话人 2”等标签。
实用技巧
说话人识别适用于 Plus 和 Premium 套餐。Free 用户可升级后使用。
说话人识别解决什么问题
它用于判断“谁在什么时候说了话”,通过音高、音色和说话模式等声学特征区分发言者。
处理后,文字会按发言者分段,例如:
- 说话人 1: 大家好,欢迎收听本期播客。
- 说话人 2: 谢谢邀请!
- 说话人 1: 我们直接开始吧……
如何开启说话人识别
- 1上传音频文件
- 2在上传设置中切换到“自定义模式”
- 3勾选“识别不同说话人”
- 4选择自动识别人数,或填写实际人数;可用范围以界面为准
- 5点击“开始转写”

自动识别与手动指定人数
自动识别(推荐):
- AI 自动估计说话人数
- 适合多数录音
- 有时可能将同一人拆成多人,或将不同人合并
手动指定人数:
- 填写录音中实际的说话人数
- 人数已知时,可为处理提供额外约束
- 适合访谈、圆桌讨论等人员明确的场景
实用技巧
不确定人数时,可选择自动识别。转写完成后仍可检查并修正说话人标签。
说话人识别的原理
AI 会分析:
- 声音特征:音高、音调和音色
- 说话模式:语速、节奏和停顿
- 声学特征:频率和能量等信息
随后将可能属于同一人的片段归为一组,并分配“说话人 1”“说话人 2”等标签。
改善识别效果的建议
- 独立麦克风:条件允许时,让每个人使用自己的麦克风
- 轮流发言:重叠语音会增加区分难度
- 清晰的人声:声音差异明显时,通常更容易区分
- 保持录音质量:音质较差会影响识别
- 减少背景噪音:噪音会干扰声音分析
查看说话人标签
开启说话人识别并完成转写后:
- 1打开转写文本
- 2进入“转写文本”标签页
- 3查看“说话人 1”“说话人 2”等标签
- 4不同说话人的发言以不同颜色区分
- 5时间戳显示各段发言的位置

导出说话人标签
文档导出是否包含说话人标签,取决于格式和导出偏好:
- TXT:开启相应设置时,可包含说话人标签
- DOCX:可在文档中保留说话人名称
- PDF:可在排版后的文档中保留说话人信息
- SRT:按时间分段导出字幕,不应假定会自动包含说话人名称
哪些情况容易识别不准
- 声音相似:两个人的声音可能被混淆
- 同时发言:重叠语音难以分离
- 音质较差:噪音大或录音不清晰
- 参与者较多:说话人数增加时,区分可能更困难
- 发言很短:快速交替的简短回应不容易归属
重要
说话人识别并非百分之百准确。重要转写结果应核对每段发言的归属。
适用场景
- 播客与访谈:分清谁说了什么
- 会议纪要:将意见对应到发言者
- 焦点小组:整理不同参与者的回应
- 法律事务记录:核对证人和律师等人的发言
- 圆桌讨论:跟踪多位参与者
- 客户通话:区分客服和客户
实用技巧
在线会议可使用会议录制功能;平台提供的参会者信息有助于整理发言,仍应核对最终归属。
标签
说话人说话人区分识别Plus
相关文章
⏱️
带时间戳的转写:跳转到录音位置
通过文本分段的时间戳定位录音,搜索文字后跳转收听,并按需导出时间信息。
🎬
SRT 时间戳格式:详解 hh:mm:ss,mmm
逐项了解 SubRip 时间戳 hh:mm:ss,mmm --> hh:mm:ss,mmm 的含义、常见格式错误、它与 VTT 和 SBV 的区别,以及如何从 TranscribeNext 导出 SRT。
📊
了解转写准确率
了解哪些因素会影响识别效果,以及如何通过录音和设置改善结果。
🔍
在转写文本中搜索
快速查找转写文本中的词语、短语或相关内容。
相关工具
- 支持的音频与视频格式 — 包括 MP3、WAV、OGG、MP4、MPEG 等格式,以及各格式的限制与使用建议。
- Mac 转写应用 — 使用 Whisper 和 Parakeet 免费离线录音与转写;离线处理时,文件不会离开您的电脑。