Krisp 发布真实场景语音基准测试:265 场实测对话重塑语音隔离标准

ADK Krisp官方 / ADK编译 2026-09-28 5 分钟 53 次浏览
速览导读 / Summary

Krisp 工程团队历时三个月,在开放式办公室、呼叫中心及车内等真实环境中录制了 265 场包含背景人声的对话,构建了首个覆盖真实背景语音的基准测试数据集。该数据集通过人工逐段标注,揭示了当前主流语音识别引擎在复杂环境下的表现。测试数据显示,Krisp 的语音隔离功能在存在次要人声时,能将词错误率(WER)降低约 75%,显著优于依赖合成数据训练的现有方案,为开发者提供了更可靠的 AI 语音模型评估依据。

数据集规模 265 场真实对话 涵盖办公室、呼叫中心、车内三种场景
WER 降低幅度 约 75% 在存在次要人声时的词错误率改善
采集周期 3 个月 跨 4 个呼叫中心楼层及 24 种办公设备

Key Insights / 核心看点

  • 1 构建首个真实场景基准测试:历时 3 个月,在办公室、呼叫中心及车内录制 265 场含背景人声的真实对话。
  • 2 性能指标突破:在存在次要人声干扰时,语音隔离功能将词错误率(WER)降低约 75%。
  • 3 打破合成数据局限:通过人工逐段标注真实录音,揭示了合成数据无法模拟的复杂沟通退化现象。
  • 4 全场景覆盖:数据涵盖开放式办公、多楼层呼叫中心及移动车辆,提供广泛的评估依据。

Krisp 发布真实场景语音基准测试:265 场实测对话重塑语音隔离标准

在 AI 语音处理领域,数据的质量直接决定了模型的边界。Krisp 工程团队近日发布了一项重磅成果:他们历时三个月,在真实的开放式办公室、繁忙的呼叫中心以及移动车辆中,录制并标注了 265 场包含背景人声的真实对话,构建了业界首个针对“次要人声”(Secondary Voice)的基准测试数据集。

为什么合成数据不够用?

传统的语音基准测试通常采用“合成法”:在干净语音上叠加噪声录音,并通过脉冲响应卷积模拟房间声学。虽然这种方法在训练数据生成上效率极高,但在评估阶段却存在致命缺陷。

Krisp 团队指出,合成数据无法模拟人类沟通中那些“未被预见的退化”。在真实的开放式办公环境中,同事的交谈、电话铃声、甚至车内后排乘客的讨论,这些复杂的背景干扰会导致语音识别模型产生误判。当这些错误转录的内容被送入大语言模型(LLM)时,往往会引发模型行为的偏移,导致最终生成的摘要或回复出现严重偏差。

“我们之所以坚持实地录制,是因为只有真实的人在真实房间里,使用真实的设备说话,才能告诉我们语音识别在嘈杂环境中究竟能做到什么程度。” —— Krisp 工程团队

极致的数据采集挑战

为了获取这 265 场高质量数据,Krisp 团队面临了巨大的现实挑战:

  • 多方协调:团队需要进入四个不同的呼叫中心楼层和开放式办公区,必须严格配合员工的排班和客户的业务节奏,而非按自己的时间表录制。
  • 硬件适配:面对 18 种不同的耳机型号和 18 种手机型号,团队甚至因为缺少一个适配器而多次丢失录制机会。蓝牙麦克风在车内的连接稳定性更是增加了变数。
  • 场景控制:在车内录制尤为困难。团队不得不反复提醒驾驶员“眼睛看路,脚本可以等”,以确保在保持安全驾驶的同时完成录音。据统计,团队在车内录制期间发送了 41 次提醒。

最终,这些录音被进行了极其精细的人工处理,每一秒都被逐段标注,区分主要说话人、次要人声及背景噪音。

核心突破与实测数据

基于该数据集,Krisp 对主流语音识别引擎进行了横向对比测试,得出了令人信服的性能指标:

  1. 词错误率(WER)大幅降低:在存在次要人声的干扰下,Krisp 的语音隔离功能能将词错误率(WER)降低约 75%。
  2. 成本效益分析:即使在已经相对干净的电话音频中引入次要人声,Krisp 的解决方案所增加的成本也略低于其带来的收益,证明了其在复杂场景下的实用价值。
  3. 场景覆盖全面:数据集涵盖了办公室、呼叫中心(4 个楼层)和移动车辆三种典型场景,确保了评估结果的广泛适用性。

对开发者的价值

对于致力于构建 AI 语音 Agent 或会议辅助工具的开发者而言,Krisp 的这一基准测试具有里程碑意义。它不再是一个简单的功能演示,而是一份可量化的性能报告。开发者可以依据此数据集验证其模型在真实嘈杂环境下的鲁棒性,避免在缺乏背景噪声数据的测试集上产生过度乐观的性能预估。

随着人机交互场景日益复杂,从人与人的对话扩展到人与机器人的交互,能够准确分离并处理背景人声的能力,已成为构建下一代智能语音助手的关键基石。

“Every recording here was made by a real person, in a real room, on a real device. That's the only way to find out what speech-to-text does when the room isn't quiet, and it's the part of this dataset that can't be synthesized.”

— Krisp Engineering Team

同主题深度资讯

查看更多 →
模型发布 2026-10-08

PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

PyTorch官方 / ADK编译 5 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo 发布 Temu GIF 转视频广告工具:15 秒内重构电商素材

AdsTurbo 推出针对 Temu 平台优化的 GIF 转视频广告工具,旨在将静态循环动图重构为具备叙事性的 15 秒短视频。该工具不仅进行格式转换,更通过 AI 提取关键帧、生成解说词与字幕、匹配多平台导出规范,帮助商家将零散的产品证据转化为高转化率的垂直视频素材,显著提升广告素材的复用性与合规性。

AdsTurbo AI官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo AI 发布无拍摄电商视频广告 SOP:单图生成 12 变体测试矩阵

AdsTurbo AI 推出针对独居电商卖家的‘无拍摄视频广告工作流’,旨在通过单一产品图和核心卖点,快速生成 12 种不同变体的短视频广告。该 SOP 强调结构化输入与模块化脚本,利用 3x2x2 组合矩阵实现高效 A/B 测试,帮助卖家在不依赖传统拍摄团队的情况下,快速验证不同钩子(Hook)、证明点(Proof)和行动号召(CTA)的转化率,大幅降低试错成本。

AdsTurbo AI官方 / ADK编译 3 分钟
audio · 免费+付费
★ 5.0 · 120评测
K

Krisp

AI噪音消除工具

Krisp是人工智能驱动的音频处理软件,提升通话和会议的语音质量。通过先进的AI技术,能实时消除背景噪音和人声干扰,让通话更加清晰。Krisp支持双向降噪,能消除你听到的噪音,能确保对方听不到你的背景杂音。具备人声分离功能,能突出主讲人的声音,让会议记录更加准确。Krisp提供会议转录和摘要功能,支持多种语言,帮助用户快速整理会议内容。最新版本增加了口音转换功能,能将不同口音的语音转换为标准发音,进一步提升沟通效率。Krisp适用于多种场景,包括远程办公、在线会议和播客制作等。支持Windows、Linux、Mac、Android和iOS等多种操作系统,确保用户在不同设备上都能使用。

查看 Krisp 使用教程与功能