AssemblyAI 发布 Universal-Streaming:毫秒级流式转录,重塑语音 Agent 交互体验

ADK AssemblyAI官方 / ADK编译 2025-06-02 4 分钟 104 次浏览
速览导读 / Summary

AssemblyAI 正式推出专为语音 Agent 设计的 Universal-Streaming 模型。该模型以约 300ms 的超低延迟提供不可变(Immutable)流式转录,解决了传统 STT 方案中“先出后改”的痛点。相比 Deepgram Nova-3,其词发射延迟降低 41%,P99 延迟缩短近一倍,并在实体识别准确率上提升 12%。凭借仅$0.15/小时的透明定价与无限并发能力,Universal-Streaming 成为构建高响应、高可靠语音交互系统的理想选择。

词发射延迟 (Median) ~300ms 相比 Nova-3 降低 41%
P99 延迟 1,012ms 相比 Nova-3 缩短近 2 倍
整体识别准确率 91% 在嘈杂真实音频环境下
实体识别错误率 -21% 数字和字母组合错误减少
定价模式 $0.15/hour 基于会话时长,无限并发

Key Insights / 核心看点

  • 1 推出 Universal-Streaming 模型,提供约 300ms 的不可变流式转录,彻底解决传统 STT‘先出后改’的痛点。
  • 2 相比 Deepgram Nova-3,中位词发射延迟降低 41%,P99 延迟缩短近 2 倍,实现极速响应。
  • 3 在关键实体(邮箱、代码、ID)识别上表现卓越,整体准确率提升 12%,专有名词识别提升 5%。
  • 4 抗噪能力显著增强,相比 Deepgram Nova-2 减少 73% 的噪声误听,相比 Nova-3 提升 28%。
  • 5 采用 $0.15/小时透明定价,支持无限并发,无容量限制,适合大规模语音 Agent 部署。

AssemblyAI 发布 Universal-Streaming:毫秒级流式转录,重塑语音 Agent 交互体验

语音智能体(Voice Agents)在过去一年中发展迅猛,但在实际落地中仍面临诸多挑战:账户号码听错、尴尬的停顿、以及过早打断用户发言等问题,直接影响了任务完成率与用户体验。为填补这一空白,AssemblyAI 于 2025 年 6 月推出了全新定制的 Universal-Streaming 流式语音识别(Speech-to-Text)模型。

核心突破:不可变流式转录与极致速度

Universal-Streaming 最显著的创新在于其不可变(Immutable)流式转录机制。传统方案通常采用“先输出部分结果,最终再修正”的模式,导致开发者必须在等待最终结果或处理易变的中间数据之间做权衡。

Universal-Streaming 彻底颠覆了这一范式:

  • 极速响应:单词发射延迟(Word Emission Latency)低至 ~300ms。相比 Deepgram Nova-3(516ms),其中位延迟降低 41%,P99 延迟更是缩短了近 2 倍(从 1,907ms 降至 1,012ms)。
  • 即时可用:从 WebSocket 接收到的每一个字符都是最终结果,永不修改。这意味着语音 Agent 可以在用户尚未说完时,基于已转录的内容进行实时判断(例如区分“嗯”、“啊”等回音与实质性打断)。
  • 灵活配置:支持按需切换标点符号和自动大小写功能,以最大化响应速度。

精准识别:攻克关键实体与噪声挑战

在语音交互中,准确识别邮箱地址、验证码、产品 ID 等关键实体至关重要。Universal-Streaming 在保持低延迟的同时,大幅提升了这些领域的准确率:

  • 整体识别准确率提升 12%:在嘈杂的真实世界音频环境下,整体词准确率高达 91%
  • 实体识别优化:数字和字母组合(如订单号、ID)的错误率减少 21%,专有名词(人名、品牌名)识别准确率提升 5%
  • 抗噪能力增强:相比 Deepgram Nova-2,因噪声导致的错误输出减少 73%;相比 Nova-3 提升 28%

此外,该模型有效解决了“自信性误听”问题,即系统看似听懂了实则错误的情况(如将“周二”听成“周四”),从而避免后续流程的连锁错误。

智能断句与透明定价

  • 智能断句(Intelligent Endpointing):结合声学特征与语义分析,比传统仅依赖静音检测(VAD)的方法更精准地判断对话结束,并内置了可靠的降级机制。
  • 无限并发与透明计费:采用基于会话时长的定价模式,$0.15/小时。无论并发量是 5 还是 50,000,均无上限、无预留费用,让开发者能按实际使用量灵活扩展。

开发者价值总结

Universal-Streaming 不仅是一个工具,更是构建自然、流畅语音交互的基石。正如 Granola 的软件工程师 Jonathan Kim 所言:

"Universal-Streaming 对于我们的实时笔记功能效果惊人。速度差异立竿见影,用户几乎能即时看到对话转录结果。这种响应感远超我们之前的方案,这正是语音 AI 领域急需的突破。"

通过消除转录延迟与错误,Universal-Streaming 助力开发者实现更自然的人机对话,提升任务完成率,并让用户在复杂环境中也能获得可靠的语音服务。

Universal-Streaming delivers the streaming speech-to-text voice agents have been missing: faster immutable transcripts, higher accuracy, built-in endpointing, and pricing that scales with you.

JD Prater, Head of Product Marketing at AssemblyAI

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
产品动态 2026-09-06

Adobe Photoshop 与 Upscale.media 联手:AI 驱动图像超分辨率技术深度解析

Adobe Photoshop 与 AI 图像增强工具 Upscale.media 宣布深度整合,旨在为专业用户提供更高效的图像超分辨率解决方案。此次合作利用先进的 AI 算法,在不依赖复杂软件学习曲线的情况下,实现从低分辨率到高清图像的无损转换。文章详细阐述了该技术在保留细节、修复模糊以及支持多格式处理方面的核心优势,并展示了从上传到下载的完整操作流程,标志着图像增强领域向更智能化、便捷化方向迈出了重要一步。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Adobe Photoshop 2025 图像分辨率优化指南:超分辨率与智能放大技巧

Adobe Photoshop 2025 在图像分辨率处理上带来了显著优化,重点介绍了如何利用内置的“超分辨率”功能无损放大 JPEG 图像。本文详细解析了从基础图像尺寸调整到高级 Camera Raw 滤镜应用的完整流程,帮助设计师和摄影师在保持画质的前提下提升输出质量。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Upscale.media 发布智能图像增强方案:AI 驱动高清修复与细节重构

Upscale.media 推出全新图像增强指南,详解如何利用 AI 技术将低分辨率图片转化为高清视觉内容。文章解析了图像上采(Upscaling)的核心原理,涵盖分辨率、锐度、色彩准确性等关键质量指标,并展示了该工具在商业展示、印刷输出及个人创作中的实际应用价值,旨在帮助用户摆脱像素化困扰,实现无损画质提升。

Upscale.media官方 / ADK编译 4 分钟