Krisp 发布背景语音隔离基准测试:STT 终于能区分‘噪音’与‘说话人’
核心突破:从‘降噪’到‘分离’的范式转移
语音识别技术在过去几年中取得了长足进步,能够轻松应对空调声、键盘敲击声等环境噪音。然而,Krisp 工程团队指出,当第二个说话人出现在同一房间时,现有的 STT(Speech-to-Text)系统往往会彻底崩溃。
这一问题的根源在于结构性差异:环境噪音(如风声、机器声)不具备人声的统计特征,模型可以通过学习其形状并将其从信号中减去;而背景人声与目标人声拥有相同的声学统计特性,传统的降噪算法无法区分二者。Krisp 认为,解决这一问题不能依赖通用的降噪模型,必须构建专门针对语音隔离(Voice Isolation)的深度学习模型。
数据驱动:265 条真实录音与 73% 的WER 下降
为了填补行业缺乏真实多说话人场景基准测试的空白,Krisp 团队历时三个月,在真实环境中收集了265 条录音,涵盖办公、呼叫中心及电话场景。这些录音并非合成数据,而是由 QA 团队在真实会议室、呼叫中心工位及车内录制,并标注了详细的元数据。
测试涵盖了11 种不同的 STT 配置和4 种语音隔离模型。结果显示,在启用 Krisp 语音隔离功能后,平均词错误率(Word Error Rate, WER)下降了 73%。这一数据不仅验证了语音隔离对提升转录准确性的巨大价值,也暴露了未隔离状态下 STT 系统的脆弱性。
三大挑战场景与评估方法论
Krisp 将评估分为三个关键阶段,覆盖了语音管道必须正确处理的三种状态:
- 仅主说话人发言:理想状态,无需处理。
- 主说话人发言,背景人声竞争:核心挑战,需保留主声并剔除背景声。
- 主说话人沉默,背景人声持续:最严峻的测试场景,输出应为静音,但 STT 常将其误转录为杂音。
测试场景包括:
- 办公环境:同事、家人在开放空间交谈。
- 呼叫中心:相邻工位同事的真实通话,背景声结构化且持续。
- 电话场景:车内噪音、人群嘈杂声叠加在已退化的电信信号上。
技术启示:Agent 与人类协作的新边界
对于依赖语音交互的 AI Agent 而言,背景人声的干扰意味着两个严重后果:
- 上下文污染:Agent 基于错误的转录内容进行推理,处理用户从未说过的内容。
- 对话接管:系统错误地将背景说话人识别为主要说话人,导致打断、抢话或回答错误问题。
Krisp 的这项基准测试不仅展示了其产品的技术实力,更为整个 AI 语音生态提供了重要的参考标准,表明语音分离已成为构建可靠语音 Agent 的必备前置环节。
官方引言: "Speech recognition has become very good at noise. It has not become good at a second person talking. We recorded 265 real conversations with a competing voice in the room... Today we are opening the dataset, the model outputs and the evaluation harness." —— Krisp Engineering Team