AssemblyAI 发布语音 AI 新套件:Speech Understanding、Guardrails 与 LLM Gateway 助力企业级应用落地

ADK AssemblyAI官方 / ADK编译 2025-10-22 5 分钟 57 次浏览
速览导读 / Summary

AssemblyAI 于 2025 年 10 月推出全新语音 AI 产品套件,旨在简化从原始音频到生产级智能应用的构建流程。核心更新包括面向结构化数据的 Speech Understanding 产品、确保内容安全的 Guardrails 以及统一语音与 LLM 洞察的 LLM Gateway。同时,基础模型 Universal-2 支持 99 种语言并大幅降低说话人识别错误,Slam 模型则在关键术语提取上实现 57% 的精度提升,帮助开发者快速构建高可用、合规的语音 AI 应用。

Universal-2 语言支持 99 种 支持自动语言检测与代码切换
说话人识别错误率降低 64% 针对 2 分钟以上的长音频文件
Slam 关键术语精度提升 57% 涵盖地址、财务数据等高精度场景
Slam 领域专业知识提升 45% 基于 1000 词上下文感知的关键术语提示

Key Insights / 核心看点

  • 1 推出 Speech Understanding 新产品,提供说话人角色标签、自定义格式及 89 种语言翻译等结构化数据能力。
  • 2 发布 Guardrails 安全护栏,支持粗俗语言过滤、敏感内容拦截及 50+ 语言的 PII 红黑,确保应用合规。
  • 3 上线 LLM Gateway,统一语音转写与 LLM 洞察,支持 GPT/Gemini 等主流模型,简化摘要与情感分析工作流。
  • 4 Universal-2 模型支持 99 种语言并降低长音频说话人识别错误 64%,Slam 模型关键术语提取精度提升 57%。

AssemblyAI 发布全新语音 AI 产品套件:构建生产级应用的新标准

在语音 AI 从实验性功能演变为关键基础设施的背景下,AssemblyAI 于 2025 年 10 月 22 日推出了其最新的产品组合与模型更新。这一系列更新旨在消除原始音频与生产就绪型语音 AI 应用之间的复杂性,帮助开发者专注于构建差异化产品并加速上市。

三大核心新产品:从数据到智能的完整链路

AssemblyAI 此次重点推出了三款旨在解决企业级痛点的新产品,覆盖了从数据理解、安全合规到智能洞察的全流程。

1. Speech Understanding:超越基础的语音转写

Speech Understanding 将语音转写升级为结构化、即用的智能数据。该产品利用 LLM 驱动的功能,无需额外集成即可提供开箱即用的智能输出。

  • 高级说话人识别:支持按角色或姓名对说话人进行标签化,而非简单的计数。
  • 自定义格式化:允许定义特定行业的领域专用格式。
  • 多语言翻译:支持 89 种语言的实时转录翻译。

2. Guardrails:生产就绪的安全防线

Guardrails 为语音 AI 管道提供全方位的保护,确保只有高质量、安全且合规的内容流入下游系统。

  • 安全护栏:自动检测并过滤粗俗语言,拦截敏感或有害内容,并在 50 多种语言中提供 PII(个人身份信息)红黑功能。
  • 运营护栏:设置语音阈值,仅转录包含最低比例语音的文件;限定转录的起止时间,仅处理包含对话的片段。

3. LLM Gateway:统一平台,一站式洞察

LLM Gateway 将语音转写、语音理解和 LLM 洞察整合到一个平台中,消除了多供应商管理的复杂性。

  • 统一 API:提供针对摘要提取、情感分析等任务的 LLM 兼容 API。
  • 无缝路由:可直接在 AssemblyAI 平台上路由请求至 GPT、Gemini 等主流 LLM。
  • 集成提示工程:支持在转录文本上直接进行提示,无需在不同工具间复制数据。

基础模型增强:精度与覆盖面的双重飞跃

Universal-2:全球通用的坚实基础

Universal-2 继续作为全球高质量语音转写的标杆,带来了显著的性能提升:

  • 语言覆盖:支持 99 种语言,具备自动语言检测能力。
  • 代码切换:自动处理英语与其他语言之间的代码切换。
  • 说话人识别优化:对于 2 分钟以上的长音频文件,说话人计数错误率降低了 64%。
  • 成本效益:起价低至 $0.15/小时。

Slam:追求极致精度的专业模型

Slam (Speech Language AI Model) 目前处于 Beta 阶段,专为关键术语提取和高精度场景设计:

  • 精度提升:在字母数字、电子邮件、地址、财务报表及组织名称等关键术语上,精度提升高达 57%。
  • 上下文感知:支持长达 1000 词的上下文感知关键术语提示,使领域专业知识提升 45%。
  • 多通道处理:增强的多通道处理能力和改进的时间戳预测。

结语

AssemblyAI 通过这套全新的产品组合,致力于让开发者摆脱繁琐的后处理管道,专注于构建卓越的客户产品。正如官方团队所言,这些更新将消除语音 AI 应用构建中的复杂性,让企业能够更快地将强大的语音 AI 产品推向市场。

These updates eliminate the complexity between raw audio and production-ready Voice AI applications, allowing you to build powerful products and get them to market faster.

AssemblyAI Product Marketing Team

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
产品动态 2026-09-06

Adobe Photoshop 与 Upscale.media 联手:AI 驱动图像超分辨率技术深度解析

Adobe Photoshop 与 AI 图像增强工具 Upscale.media 宣布深度整合,旨在为专业用户提供更高效的图像超分辨率解决方案。此次合作利用先进的 AI 算法,在不依赖复杂软件学习曲线的情况下,实现从低分辨率到高清图像的无损转换。文章详细阐述了该技术在保留细节、修复模糊以及支持多格式处理方面的核心优势,并展示了从上传到下载的完整操作流程,标志着图像增强领域向更智能化、便捷化方向迈出了重要一步。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Adobe Photoshop 2025 图像分辨率优化指南:超分辨率与智能放大技巧

Adobe Photoshop 2025 在图像分辨率处理上带来了显著优化,重点介绍了如何利用内置的“超分辨率”功能无损放大 JPEG 图像。本文详细解析了从基础图像尺寸调整到高级 Camera Raw 滤镜应用的完整流程,帮助设计师和摄影师在保持画质的前提下提升输出质量。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Upscale.media 发布智能图像增强方案:AI 驱动高清修复与细节重构

Upscale.media 推出全新图像增强指南,详解如何利用 AI 技术将低分辨率图片转化为高清视觉内容。文章解析了图像上采(Upscaling)的核心原理,涵盖分辨率、锐度、色彩准确性等关键质量指标,并展示了该工具在商业展示、印刷输出及个人创作中的实际应用价值,旨在帮助用户摆脱像素化困扰,实现无损画质提升。

Upscale.media官方 / ADK编译 4 分钟