Krisp 发布 Voice Isolation 2.5:专为 STT 优化,大幅降低竞对语音识别错误率
更新背景:现代 STT 的盲区
在 AI 语音交互领域,语音隔离(Voice Isolation, VI)一直是提升体验的关键技术。Krisp 旗下的 VIVA 系统已在超过 10 亿分钟的语音 AI 对话中运行,其核心逻辑是将 VI 作为前置处理层,负责去除背景噪音和干扰人声,从而让后续的语音识别(STT)模型能更清晰地捕捉主说话人的意图。
然而,Krisp 在观察客户反馈时发现了一个长期存在的痛点:人类听觉与 STT 模型的感知方式并不一致。早期的 VI 模型为了在嘈杂环境中分离主声,往往会“激进”地切除背景人声。对于人类耳朵而言,这听起来依然清晰;但对于 STT 模型,这种被过度处理的声音特征容易被误判为噪声,导致转录结果中出现大量单词缺失(Deletions),而非单纯的错误。
核心突破:VI 2.5 的技术革新
为了解决“转录缺失”问题,Krisp 工程团队推出了 Voice Isolation 2.5。该版本不再单纯追求“静音”,而是致力于“精准分离”,旨在让 STT 模型能以更高的保真度转录隔离后的音频。
1. 显著降低竞对语音场景下的 WER
在竞对语音(Competing Speech)场景下,即主说话人与背景人声同时出现时,VI 2.5 展现了惊人的效果:
- 平均词错误率(WER)下降 46.4%:从处理前的 15.35% 降至 8.22%。
- 竞对语音场景专项提升:在决定通话成败的竞对语音案例中,WER 从 35.92% 骤降至 10.90%,降幅达 69.7%。
2. 消除“清洁音频”惩罚(Clean-Audio Penalty)
这是 VI 2.5 最关键的改进之一。在之前的版本中,为了分离背景音,模型可能会无意中损伤主声,导致在安静环境下(无背景音)的 WER 反而上升。VI 2.5 通过更精细的算法,将无背景音场景下的 WER 拉回至 2.15%,与未处理音频的基准线(2.10%)几乎持平。这意味着开发者可以全天候开启隔离功能,无需担心在安静环境下的转录质量下降。
3. 轻量级部署支持边缘计算
考虑到算力成本,Krisp 推出了 VI 2.5 Lite 版本。该版本体积约为全量版的 3.5 倍,但在典型通话场景下,其转录效果与全量模型持平。这使得在 CPU 受限的设备或边缘端部署实时语音 AI 成为可能,打破了算力瓶颈。
实测数据与评估标准
Krisp 基于 1,685 条真实录音(约 7 小时音频)进行了严格测试,涵盖三种声学条件,并使用了来自七家主流厂商的 10 种不同 STT 引擎进行交叉验证。结果显示,VI 2.5 在所有测试引擎上均实现了 WER 的降低,证明了其 STT 无关性(STT-agnostic)的优势。
| 测试条件 | 文件数 | 时长 | 核心表现 |
|---|---|---|---|
| 主声 + 竞对语音 | 130 | 3.5 小时 | WER 从 35.92% 降至 10.90% |
| 单声(高难度声学) | 255 | 1.5 小时 | 高回声环境下的鲁棒性提升 |
| 单声(标准声学) | 1,300 | 2.0 小时 | 基准 WER 维持在 2.15% |
对开发者的价值
对于构建 AI 会议助手、智能客服或实时翻译应用的开发者而言,VI 2.5 的发布意味着:
- 更高的准确率:无需微调 STT 模型即可享受接近 90% 的竞对语音识别准确率。
- 更灵活的架构:Lite 版本降低了边缘部署的门槛,适合资源受限的 IoT 设备。
- 更稳定的体验:消除了因环境安静导致的转录质量波动,提升了端到端应用的可靠性。
Krisp 表示,这一更新标志着其语音 AI 技术从“降噪”向“增强语义理解”的跨越,旨在让 AI 真正听懂复杂多变的真实世界对话。