AssemblyAI 发布 Universal-3.6 Pro:终结语音代理短回答识别难题
在语音代理(Voice Agent)日益普及的当下,语音识别(STT)的准确性直接决定了自动化流程的成功率。然而,现实通话中的短促回答、背景噪音干扰以及多语言混用,往往是导致意图识别失败和实体提取错误的根源。
2026 年 9 月 29 日,AssemblyAI 正式发布了 Universal-3.6 Pro Realtime。作为 Universal-3.5 Pro 的直接升级,该模型专门针对海量真实的语音代理和电话对话进行了训练,旨在解决“短回答识别不准”这一长期痛点,并大幅提升了在复杂环境下的鲁棒性。
核心突破:精准捕捉“短回答”与“多语言切换”
在真实的客服或预约场景中,决定通话走向的关键往往仅有一个词:"no"、"nah"或"yeah"。一旦 STT 模型将这些短促的否定或肯定误判,不仅会导致后续流程错误,更会引发退款或人工升级,造成巨大的运营成本。
Universal-3.6 Pro 在此方面取得了显著进展:
- 短回答错误率大幅下降:在英文语音代理基准测试中,短回答错误率从 3.5 Pro 的 2.65% 降至 1.45%。这意味着在嘈杂环境中,确认错误的次数减少了 52%。
- 多语言无缝切换:该模型支持 32 种语言,并具备自动语言检测能力。它能够有效处理用户在句子中突然切换语言(Code-switching)的情况,将代码切换场景下的词错误率(WER)控制在 7.20%,远低于竞品的 17.13% 甚至 52.86%。
硬核指标:在强噪环境下依然保持高精度
AssemblyAI 在测试中使用了 12 个说话人组、3 种噪音环境下的 12,460 个脚本场景,将 Universal-3.6 Pro 与 ElevenLabs Scribe v2 及 Deepgram 等竞品进行了公平对比。
关键性能指标 (Metrics)
| 指标维度 | Universal-3.6 Pro | ElevenLabs Scribe v2 | Deepgram Nova-3 | Deepgram Flux EN |
|---|---|---|---|---|
| 实体错误率 (Entity Error) | 14.4% | 18.5% | 26.1% | 30.1% |
| 词错误率 (Word Error Rate) | 5.19% | 7.78% | 8.64% | 13.50% |
| 代码切换 WER | 7.20% | 13.01% | 17.13% | 52.86% |
| 短回答 WER | 3.44% | 5.13% | 7.46% | 6.53% |
注:实体错误率越低越好;代码切换 WER 中 Deepgram Nova-3 多语言版本在相同测试集上高达 54.71%。
噪音鲁棒性提升
针对背景噪音导致的“背景语音泄漏”(Background speech leakage),Universal-3.6 Pro 的表现尤为出色:
- 背景噪音抑制:每 1,000 字中的背景语音泄漏词数从 3.5 Pro 的 3.53 降至 2.52,在强噪音环境下更是从 6.82 降至 4.69。
- 静默/噪音误识率:在包含挂断音乐、线路噪音和纯静音的 2,950 个片段测试中,该模型仅在 0.27% 的情况下返回文本,而 Deepgram Flux EN 的误识率高达 38.75%。
技术架构:原生降噪与多语言融合
Universal-3.6 Pro 并非简单的模型微调,而是架构层面的重构:
- 原生语音聚焦(Voice Focus):该模型内置了可选的语音聚焦阶段,能够智能抑制麦克风中距离较远的人声(如办公室同事的交谈),而无需依赖前置的降噪插件。这种“端到端”的处理方式避免了传统降噪器对音频频谱的破坏,从而保留了模型所需的声学线索。
- 统一多语言模型:不同于需要为每种语言单独部署的解决方案,Universal-3.6 Pro 通过一个模型服务 32 种语言,实现了真正的自动语言检测,消除了因语言菜单设置不当导致的上下文丢失。
开发者价值与应用场景
对于依赖语音交互的开发者而言,Universal-3.6 Pro 意味着更低的运营成本(Fewer Escalations)和更高的用户体验。
- 减少确认循环:由于短回答识别率提升,开发者可以减少不必要的“请确认”确认环节,优化对话流程。
- 提升实体提取精度:在姓名、电话号码、日期等关键实体的提取上,错误率显著降低,直接提升了自动化任务的成功率。
该模型目前以 $0.45/小时 的定价提供,并支持实时流式处理,即刻可用。
“我们的目标是让语音代理能够听懂人类真实的对话,无论是在安静的电话里,还是在嘈杂的办公室中。” —— AssemblyAI 团队