AS
AI 音频语音 发布方:Assemblyai ⭐ 5 累计 29 条资讯动态

AssemblyAI 官方最新动态与版本发布资讯

转录和理解语音的AI模型

官方发布与版本更新历史记录

第 1 / 3 页 (共 29 条)
2026-09-04 产品动态 | 版本升级 | 模型发布 | 技术解读
官方原文

AssemblyAI 发布重大性能升级:RTF低至 0.008x,成本降低 40% 开启实时语音 AI 新纪元

AssemblyAI 宣布推出重大 API 性能升级,将推理延迟(RTF)优化至低至 0.008x,90% 以上的音频文件处理时间缩短至 45 秒以内。同时,异步与实时语音转文本模型价格下调 40%,显著降低开发者成本。此次升级依托智能微批处理(Intelligent Mini Batching)与硬件并行化架构,在保持行业领先准确率(WER 约 6%)的同时,实现了大规模并发处理能力的质的飞跃。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2026-09-04 技术解读 | 版本升级 | 开发者教程
官方原文

AssemblyAI 发布 Zoom 会议音频深度分析 Node.js 教程:从 RTMP 流转到 LLM 智能洞察

AssemblyAI 发布最新 Node.js 开发指南,详解如何利用其 SDK 与 LLM Gateway 深度分析 Zoom 会议音频。教程涵盖两种核心架构:直接转录已保存录音与通过 RTMP 流式捕获实时音频。文章对比了 Zoom 内置转录的局限性,强调 AssemblyAI 在准确率与高级语义理解上的优势,并提供了从环境配置到 FFmpeg 音频处理的完整代码示例,助力开发者构建企业级会议智能分析系统。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2026-09-04 产品动态 | 版本升级 | 技术解读 | 生态合作
官方原文

AssemblyAI 发布 .NET SDK:C# 开发者实现语音 AI 实时转录与 LLM 集成指南

AssemblyAI 正式推出针对 C# 开发者的专用 SDK 文档,利用内置 HttpClient 实现音频文件转录、WebSocket 实时流式语音识别及 LLM Gateway 深度集成。开发者可通过此方案在 .NET 应用中高效处理语音数据,支持从本地文件上传到实时麦克风输入的全流程自动化,并无缝调用 Claude 等大模型进行语义分析。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2026-09-04 产品动态 | 版本升级 | 技术解读 | 生态合作
官方原文

AssemblyAI 发布 LiveKit 实时语音转文本集成,构建多模态 AI 应用新范式

AssemblyAI 正式推出 Python LiveKit 集成,赋能开发者在 LiveKit 实时音视频架构中无缝部署 AI Agent。该更新支持将 Streaming Speech-to-Text 能力直接嵌入 LiveKit 房间,实现音频流的实时转录与后端处理。开发者可借此构建具备实时语音交互、字幕生成及多模态分析能力的下一代应用,无需额外维护独立 STT 服务即可实现低延迟、高并发的实时语音处理。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2026-09-04 技术解读 | 模型评估 | 语音 AI
官方原文

AssemblyAI 发布 2026 年语音识别模型评估新指南:超越 WER 的语义与实体精度

AssemblyAI 发布深度指南,指出 2026 年传统的 Word Error Rate (WER) 已无法真实反映生产环境下的语音模型表现。文章提出 Semantic WER(语义 WER)和 Missed Entity Rate(实体漏报率)作为核心新指标,强调基于真实噪声数据的基准测试重要性,并详细解析 Universal-3.5 Pro 等旗舰模型的评估方法论。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2026-09-04 模型发布 | 语音转写 | 多语言 AI | 技术解读
官方原文

AssemblyAI 发布多语言文本格式化升级:西班牙语与德语语境优化

AssemblyAI 宣布对其 Universal 语音转写模型进行重大升级,重点优化西班牙语和德语的上下文文本格式化能力。新模型通过神经网络架构,显著提升了标点符号、大小写规范及数字格式化的准确性。数据显示,新模型在西班牙语标点错误率降低 15.3%,德语名词大写 F1 分数提升至 95.8%,并大幅改善了逆文本规范化(ITN)表现,使生成的文本更符合母语者习惯,大幅提升了专业度与可读性。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2026-07-14 产品动态 | 版本升级 | 技术解读
官方原文

AssemblyAI 发布 Sync API:短音频转录零延迟,134ms 极速响应

AssemblyAI 正式推出 Sync API,专为短音频转录场景(如语音指令、语音输入、IVR 通话)打造。该 API 摒弃了传统的异步轮询或 WebSocket 长连接模式,仅需一次 HTTP POST 请求即可在约 134ms 内返回基于 Universal-3.5 Pro 模型的完整转录结果。其核心优势在于将响应速度提升至亚秒级,同时保持旗舰级准确率(短音频 WER 1.59%),完美适配语音助手、语音输入及即时通讯等对低延迟有严苛要求的场景。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2026-07-07 模型发布 | 技术解读 | 语音识别 | 多语言支持
官方原文

AssemblyAI 发布 Universal-3.5 Pro:原生支持 18 语种代码切换与高精度说话人分离

AssemblyAI 正式推出旗舰级异步语音转写模型 Universal-3.5 Pro。该模型原生支持跨 18 种语言的代码切换(Code-Switching),无需后处理即可精准识别混合语种对话;同时采用联合建模架构,实现了业界最准确的说话人分离(Speaker Diarization),有效解决重叠语音与短轮次对话的归因难题。相比竞品,其在代码切换场景下的词错误率(WER)显著降低,为复杂会议记录与客服质检提供全新标准。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2026-06-23 产品动态 | 模型发布 | 技术解读
官方原文

AssemblyAI 发布 Universal-3.5 Pro Realtime:首个支持 Agent 上下文与多语种实时语音识别模型

AssemblyAI 正式推出旗舰级实时语音识别模型 Universal-3.5 Pro Realtime。该模型首次将 Agent 的意图作为核心上下文输入,显著提升了短促指令、代码切换及复杂实体(如邮箱、地址)的识别准确率。同时支持 18 种语言及背景噪声抑制,实测在 2 万条语音数据上 Word Error Rate 降低 10.2%,为构建高可靠语音 Agent 提供了全新基准。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2025-10-22 产品动态 | 版本升级 | 模型发布 | 技术解读
官方原文

AssemblyAI 发布语音 AI 新套件:Speech Understanding、Guardrails 与 LLM Gateway 助力企业级应用落地

AssemblyAI 于 2025 年 10 月推出全新语音 AI 产品套件,旨在简化从原始音频到生产级智能应用的构建流程。核心更新包括面向结构化数据的 Speech Understanding 产品、确保内容安全的 Guardrails 以及统一语音与 LLM 洞察的 LLM Gateway。同时,基础模型 Universal-2 支持 99 种语言并大幅降低说话人识别错误,Slam 模型则在关键术语提取上实现 57% 的精度提升,帮助开发者快速构建高可用、合规的语音 AI 应用。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文