Krisp 发布 Voice Isolation 2.5:专为 STT 优化,大幅降低竞对语音识别错误率

ADK Krisp官方 / ADK编译 2026-08-12 5 分钟 104 次浏览
速览导读 / Summary

Krisp 正式推出 Voice Isolation (VI) 2.5 版本,标志着其语音隔离技术从“为人类耳朵设计”转向“为语音识别引擎(STT)优化”。针对现代 STT 模型在处理背景人声干扰时的弱点,VI 2.5 通过更精细的语音分离算法,将竞对语音场景下的平均词错误率(WER)降低了 46.4%,同时几乎消除了因过度降噪导致的原声失真问题。新版本提供全量与轻量级两种部署选项,显著提升了 AI 会议助手及呼叫中心场景下的转录与交互准确性。

竞对语音场景 WER 35.92% -> 10.90% 降幅达 69.7%,解决核心识别难题
平均 WER 降幅 46.4% 从 15.35% 降至 8.22%
安静环境 WER 2.15% 与未处理基准线(2.10%)几乎持平
模型体积 Lite 版本 比全量版小 3.5 倍,降低算力门槛

Key Insights / 核心看点

  • 1 专为 STT 优化:解决传统隔离模型导致的转录单词缺失问题,显著降低竞对语音场景下的词错误率(WER)。
  • 2 消除清洁音频惩罚:在无背景音环境下,保持与未处理音频一致的转录质量,支持全天候开启隔离功能。
  • 3 轻量级部署:推出 VI 2.5 Lite 版本,体积缩小 3.5 倍,降低 CPU 成本,适配边缘计算场景。
  • 4 跨引擎验证:在 10 种主流 STT 引擎上均实现平均 46.4% 的 WER 下降,具备广泛的兼容性。

Krisp 发布 Voice Isolation 2.5:专为 STT 优化,大幅降低竞对语音识别错误率

更新背景:现代 STT 的盲区

在 AI 语音交互领域,语音隔离(Voice Isolation, VI)一直是提升体验的关键技术。Krisp 旗下的 VIVA 系统已在超过 10 亿分钟的语音 AI 对话中运行,其核心逻辑是将 VI 作为前置处理层,负责去除背景噪音和干扰人声,从而让后续的语音识别(STT)模型能更清晰地捕捉主说话人的意图。

然而,Krisp 在观察客户反馈时发现了一个长期存在的痛点:人类听觉与 STT 模型的感知方式并不一致。早期的 VI 模型为了在嘈杂环境中分离主声,往往会“激进”地切除背景人声。对于人类耳朵而言,这听起来依然清晰;但对于 STT 模型,这种被过度处理的声音特征容易被误判为噪声,导致转录结果中出现大量单词缺失(Deletions),而非单纯的错误。

核心突破:VI 2.5 的技术革新

为了解决“转录缺失”问题,Krisp 工程团队推出了 Voice Isolation 2.5。该版本不再单纯追求“静音”,而是致力于“精准分离”,旨在让 STT 模型能以更高的保真度转录隔离后的音频。

1. 显著降低竞对语音场景下的 WER

在竞对语音(Competing Speech)场景下,即主说话人与背景人声同时出现时,VI 2.5 展现了惊人的效果:

  • 平均词错误率(WER)下降 46.4%:从处理前的 15.35% 降至 8.22%。
  • 竞对语音场景专项提升:在决定通话成败的竞对语音案例中,WER 从 35.92% 骤降至 10.90%,降幅达 69.7%。

2. 消除“清洁音频”惩罚(Clean-Audio Penalty)

这是 VI 2.5 最关键的改进之一。在之前的版本中,为了分离背景音,模型可能会无意中损伤主声,导致在安静环境下(无背景音)的 WER 反而上升。VI 2.5 通过更精细的算法,将无背景音场景下的 WER 拉回至 2.15%,与未处理音频的基准线(2.10%)几乎持平。这意味着开发者可以全天候开启隔离功能,无需担心在安静环境下的转录质量下降。

3. 轻量级部署支持边缘计算

考虑到算力成本,Krisp 推出了 VI 2.5 Lite 版本。该版本体积约为全量版的 3.5 倍,但在典型通话场景下,其转录效果与全量模型持平。这使得在 CPU 受限的设备或边缘端部署实时语音 AI 成为可能,打破了算力瓶颈。

实测数据与评估标准

Krisp 基于 1,685 条真实录音(约 7 小时音频)进行了严格测试,涵盖三种声学条件,并使用了来自七家主流厂商的 10 种不同 STT 引擎进行交叉验证。结果显示,VI 2.5 在所有测试引擎上均实现了 WER 的降低,证明了其 STT 无关性(STT-agnostic)的优势。

测试条件 文件数 时长 核心表现
主声 + 竞对语音 130 3.5 小时 WER 从 35.92% 降至 10.90%
单声(高难度声学) 255 1.5 小时 高回声环境下的鲁棒性提升
单声(标准声学) 1,300 2.0 小时 基准 WER 维持在 2.15%

对开发者的价值

对于构建 AI 会议助手、智能客服或实时翻译应用的开发者而言,VI 2.5 的发布意味着:

  1. 更高的准确率:无需微调 STT 模型即可享受接近 90% 的竞对语音识别准确率。
  2. 更灵活的架构:Lite 版本降低了边缘部署的门槛,适合资源受限的 IoT 设备。
  3. 更稳定的体验:消除了因环境安静导致的转录质量波动,提升了端到端应用的可靠性。

Krisp 表示,这一更新标志着其语音 AI 技术从“降噪”向“增强语义理解”的跨越,旨在让 AI 真正听懂复杂多变的真实世界对话。

People and STT models don’t listen the same way. VI 2.5 is built to address that feedback by isolating voice more surgically and shaping the output so STT models transcribe it more faithfully.

Krisp Engineering Team

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
产品动态 2026-09-06

Adobe Photoshop 与 Upscale.media 联手:AI 驱动图像超分辨率技术深度解析

Adobe Photoshop 与 AI 图像增强工具 Upscale.media 宣布深度整合,旨在为专业用户提供更高效的图像超分辨率解决方案。此次合作利用先进的 AI 算法,在不依赖复杂软件学习曲线的情况下,实现从低分辨率到高清图像的无损转换。文章详细阐述了该技术在保留细节、修复模糊以及支持多格式处理方面的核心优势,并展示了从上传到下载的完整操作流程,标志着图像增强领域向更智能化、便捷化方向迈出了重要一步。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Adobe Photoshop 2025 图像分辨率优化指南:超分辨率与智能放大技巧

Adobe Photoshop 2025 在图像分辨率处理上带来了显著优化,重点介绍了如何利用内置的“超分辨率”功能无损放大 JPEG 图像。本文详细解析了从基础图像尺寸调整到高级 Camera Raw 滤镜应用的完整流程,帮助设计师和摄影师在保持画质的前提下提升输出质量。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Upscale.media 发布智能图像增强方案:AI 驱动高清修复与细节重构

Upscale.media 推出全新图像增强指南,详解如何利用 AI 技术将低分辨率图片转化为高清视觉内容。文章解析了图像上采(Upscaling)的核心原理,涵盖分辨率、锐度、色彩准确性等关键质量指标,并展示了该工具在商业展示、印刷输出及个人创作中的实际应用价值,旨在帮助用户摆脱像素化困扰,实现无损画质提升。

Upscale.media官方 / ADK编译 4 分钟
audio · 免费+付费
★ 5.0 · 120评测
K

Krisp

AI噪音消除工具

Krisp是人工智能驱动的音频处理软件,提升通话和会议的语音质量。通过先进的AI技术,能实时消除背景噪音和人声干扰,让通话更加清晰。Krisp支持双向降噪,能消除你听到的噪音,能确保对方听不到你的背景杂音。具备人声分离功能,能突出主讲人的声音,让会议记录更加准确。Krisp提供会议转录和摘要功能,支持多种语言,帮助用户快速整理会议内容。最新版本增加了口音转换功能,能将不同口音的语音转换为标准发音,进一步提升沟通效率。Krisp适用于多种场景,包括远程办公、在线会议和播客制作等。支持Windows、Linux、Mac、Android和iOS等多种操作系统,确保用户在不同设备上都能使用。

查看 Krisp 使用教程与功能