Krisp 发布 VIVA 2.0:为语音 AI 代理打造下一代语音基础设施
背景:从实验室到生产环境的鸿沟
在语音 AI 领域,一个普遍现象是:演示环境下的语音代理听起来完美无缺,但一旦部署到生产环境,问题便接踵而至。无论是机场嘈杂的背景音、劣质麦克风的回声,还是网络编码压缩带来的信号损耗,都会导致语音识别率(WER)从 5% 飙升至 30% 甚至更高。
与此同时,即使音频足够纯净,语音代理的对话感依然生硬。人类交流依赖于微妙的非语言线索——何时该停顿、何时该接话、如何判断对方正在思考而非结束发言。目前的多数语音代理仍基于简单的“静音即发言”规则,缺乏这种预测性,导致用户体验割裂。
核心突破:VIVA 2.0 的双重革新
Krisp 凭借八年在真实语音流量上的积累,推出了 VIVA 2.0。这不仅仅是一个降噪工具,而是一个理解对话的语音基础设施。其核心突破体现在以下两个方面:
1. 语音隔离引擎 v3 (Voice Isolation v3)
针对生产环境中高达 15-30% 的单词错误率,VIVA 2.0 对核心隔离引擎进行了彻底重构。
- 深度去噪:不仅能过滤背景噪音,还能有效分离其他说话人的声音、消除房间回声及编码伪影。
- 跨语言适配:支持全球多种语言与口音,确保在不同场景下都能提取出最纯净的主讲人语音。
- 直接提升 WER:为下游的语音转文字(STT)和 LLM 提供更干净的输入,从源头降低误识别风险。
2. 预测式轮转检测 v3 (Turn Prediction v3)
解决了语音代理“被动等待”的缺陷,使其具备人类般的对话直觉。
- 主动预测:不再单纯依赖静音时长来判断发言权,而是通过分析语音特征预测对方何时结束发言。
- 自然交互:智能识别“嗯”、“啊”等填充词,区分“思考中的停顿”与“结束后的沉默”,从而在最佳时机介入或保持静默。
- 无缝衔接:显著减少因抢话或沉默造成的对话中断感。
应用价值与生态影响
VIVA 2.0 采用服务器端 SDK 架构,可无缝嵌入现有的语音管道(如 Speech-to-Text 之前)。目前,该引擎已部署于 Daily、Vapi、LiveKit、Vodex 等主流语音平台,并被全球最大的人工智能实验室采用。
根据早期采用者的反馈,集成 VIVA 的语音代理团队在关键指标上取得了显著改善:
- 轮转准确率提升 3.5 倍:对话逻辑更加顺畅。
- 通话丢失率降低 50%:有效应对嘈杂环境导致的连接中断。
- 客户满意度提升 30%:用户体验更加自然可信。
Krisp 表示,VIVA 2.0 标志着语音 AI 从“能听懂”向“能自然交流”的关键跨越,为构建大规模、高可靠性的语音代理基础设施奠定了坚实基础。
"VIVA 2.0 不仅仅是在清理音频,它是在理解对话。" —— Krisp 工程团队