TranscribeNextTranscribeNext.com
🗣️
中阶

什么是说话人识别

了解 TranscribeNext 如何区分录音中的说话人,并为发言添加标签。

阅读时间约 4 分钟 TranscribeNext 团队 更新日期:2025年1月15日

说话人识别会区分录音中的不同声音,并为各段发言添加“说话人 1”“说话人 2”等标签。

实用技巧

说话人识别适用于 Plus 和 Premium 套餐。Free 用户可升级后使用。

说话人识别解决什么问题

它用于判断“谁在什么时候说了话”,通过音高、音色和说话模式等声学特征区分发言者。

处理后,文字会按发言者分段,例如:

  • 说话人 1: 大家好,欢迎收听本期播客。
  • 说话人 2: 谢谢邀请!
  • 说话人 1: 我们直接开始吧……

如何开启说话人识别

  1. 1上传音频文件
  2. 2在上传设置中切换到“自定义模式”
  3. 3勾选“识别不同说话人”
  4. 4选择自动识别人数,或填写实际人数;可用范围以界面为准
  5. 5点击“开始转写”
已勾选说话人识别的上传窗口

自动识别与手动指定人数

自动识别(推荐):

  • AI 自动估计说话人数
  • 适合多数录音
  • 有时可能将同一人拆成多人,或将不同人合并

手动指定人数:

  • 填写录音中实际的说话人数
  • 人数已知时,可为处理提供额外约束
  • 适合访谈、圆桌讨论等人员明确的场景

实用技巧

不确定人数时,可选择自动识别。转写完成后仍可检查并修正说话人标签。

说话人识别的原理

AI 会分析:

  • 声音特征:音高、音调和音色
  • 说话模式:语速、节奏和停顿
  • 声学特征:频率和能量等信息

随后将可能属于同一人的片段归为一组,并分配“说话人 1”“说话人 2”等标签。

改善识别效果的建议

  • 独立麦克风:条件允许时,让每个人使用自己的麦克风
  • 轮流发言:重叠语音会增加区分难度
  • 清晰的人声:声音差异明显时,通常更容易区分
  • 保持录音质量:音质较差会影响识别
  • 减少背景噪音:噪音会干扰声音分析

查看说话人标签

开启说话人识别并完成转写后:

  1. 1打开转写文本
  2. 2进入“转写文本”标签页
  3. 3查看“说话人 1”“说话人 2”等标签
  4. 4不同说话人的发言以不同颜色区分
  5. 5时间戳显示各段发言的位置
显示说话人标签和颜色区分的转写视图

导出说话人标签

文档导出是否包含说话人标签,取决于格式和导出偏好:

  • TXT:开启相应设置时,可包含说话人标签
  • DOCX:可在文档中保留说话人名称
  • PDF:可在排版后的文档中保留说话人信息
  • SRT:按时间分段导出字幕,不应假定会自动包含说话人名称

哪些情况容易识别不准

  • 声音相似:两个人的声音可能被混淆
  • 同时发言:重叠语音难以分离
  • 音质较差:噪音大或录音不清晰
  • 参与者较多:说话人数增加时,区分可能更困难
  • 发言很短:快速交替的简短回应不容易归属

重要

说话人识别并非百分之百准确。重要转写结果应核对每段发言的归属。

适用场景

  • 播客与访谈:分清谁说了什么
  • 会议纪要:将意见对应到发言者
  • 焦点小组:整理不同参与者的回应
  • 法律事务记录:核对证人和律师等人的发言
  • 圆桌讨论:跟踪多位参与者
  • 客户通话:区分客服和客户

实用技巧

在线会议可使用会议录制功能;平台提供的参会者信息有助于整理发言,仍应核对最终归属。

标签

说话人说话人区分识别Plus

相关文章

⏱️

带时间戳的转写:跳转到录音位置

通过文本分段的时间戳定位录音,搜索文字后跳转收听,并按需导出时间信息。

🎬

SRT 时间戳格式:详解 hh:mm:ss,mmm

逐项了解 SubRip 时间戳 hh:mm:ss,mmm --> hh:mm:ss,mmm 的含义、常见格式错误、它与 VTT 和 SBV 的区别,以及如何从 TranscribeNext 导出 SRT。

📊

了解转写准确率

了解哪些因素会影响识别效果,以及如何通过录音和设置改善结果。

🔍

在转写文本中搜索

快速查找转写文本中的词语、短语或相关内容。

相关工具

  • 支持的音频与视频格式 — 包括 MP3、WAV、OGG、MP4、MPEG 等格式,以及各格式的限制与使用建议。
  • Mac 转写应用 — 使用 Whisper 和 Parakeet 免费离线录音与转写;离线处理时,文件不会离开您的电脑。
什么是说话人识别 | TranscribeNext 说明