AS
AI 音频语音 发布方:Assemblyai ⭐ 5 累计 29 条资讯动态

AssemblyAI 官方最新动态与版本发布资讯

转录和理解语音的AI模型

官方发布与版本更新历史记录

第 2 / 3 页 (共 29 条)
2025-09-11 产品动态 | 模型发布 | 技术解读 | 语音 AI
官方原文

AssemblyAI 发布流式语音识别关键术语增强:实时精准捕捉核心词汇

AssemblyAI 正式推出 Keyterms Prompting 功能,针对流式语音识别(Streaming STT)中的领域专有名词(如产品名、人名、医学术语)进行实时增强。该功能允许用户传入最多 100 个自定义关键术语,显著提升特定词汇的识别准确率。相比行业基准 Deepgram Nova-3,关键术语识别准确率平均提升 21%,且仅增加$0.04/小时的费用,为语音 Agent 和会议转录等场景提供了高性价比的解决方案。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2025-08-26 产品动态 | 模型发布 | 技术解读
官方原文

AssemblyAI 发布 Universal 2.0:99 语种统一定价,打破语音 AI 全球化壁垒

AssemblyAI 正式推出 Universal 2.0 模型,以$0.27/小时的统一价格支持全球 99 种语言,并实现全语种自动语言检测与 95 种语种的说话人分离功能。相比竞品,其准确率提升 53.2%,处理速度提升 2-3 倍,彻底解决了多语言语音 AI 成本高、精度低、功能割裂的行业痛点。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2025-06-02 产品动态 | 模型发布 | 技术解读 | 语音 AI
官方原文

AssemblyAI 发布 Universal-Streaming:毫秒级流式转录,重塑语音 Agent 交互体验

AssemblyAI 正式推出专为语音 Agent 设计的 Universal-Streaming 模型。该模型以约 300ms 的超低延迟提供不可变(Immutable)流式转录,解决了传统 STT 方案中“先出后改”的痛点。相比 Deepgram Nova-3,其词发射延迟降低 41%,P99 延迟缩短近一倍,并在实体识别准确率上提升 12%。凭借仅$0.15/小时的透明定价与无限并发能力,Universal-Streaming 成为构建高响应、高可靠语音交互系统的理想选择。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2025-02-20 产品动态 | 模型发布 | 技术解读
官方原文

AssemblyAI 发布 Universal 2.0:英语、德语、西班牙语语音转写精度与速度双重突破

AssemblyAI 于 2025 年 2 月 20 日推出 Universal 2.0 模型,重点优化英语、德语和西班牙语的语音转写能力。相比 2024 年 10 月版本,新模型在推理速度提升 27.4% 的同时,大幅降低了单词错误率(WER)。针对企业级应用痛点,新模型在专有名词识别(PNER)、数字格式(如邮箱、电话)及重音口音处理上实现了显著改进,解决了传统 ASR 评估中忽视的“最后一公里”问题。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2025-02-03 产品动态 | 版本升级 | 合规安全 | 企业级 AI
官方原文

AssemblyAI 发布企业级安全升级:新增欧盟数据驻留与 ISO 27001 认证

AssemblyAI 于 2025 年 2 月宣布重大安全升级,新增欧盟数据驻留能力、获得 ISO 27001 认证并扩展 SOC 2 Type 2 范围。此次更新旨在满足全球企业合规需求,通过 API 参数切换实现数据主权控制,消除跨国部署障碍,助力企业在受监管市场快速落地 AI 语音解决方案。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-11-11 模型发布 | 版本升级 | 技术解读
官方原文

AssemblyAI 发布 Universal-2:重塑语音转写精度,专为行业实战场景打造

AssemblyAI 正式推出 Universal-2 语音转写模型,旨在解决传统学术指标与实际应用脱节的问题。该模型在保留原有 WER 优势的基础上,重点优化了数字字母串(Alphanumerics)和专有名词(Proper Nouns)的识别精度。文章通过销售辅导、远程医疗等真实案例,展示了 Universal-2 在提升客户体验、减少医疗记录错误及加速保险理赔方面的实际价值,标志着语音 AI 从实验室走向大规模商业落地的关键一步。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-09-19 产品动态 | 生态合作 | 无代码平台 | 语音 AI
官方原文

AssemblyAI 携手 Activepieces 发布集成组件,赋能无代码语音 AI 自动化

AssemblyAI 正式推出面向 Activepieces 无代码自动化平台的官方集成组件。该集成将 AssemblyAI 的语音识别、音频智能分析及 LeMUR 大模型能力无缝嵌入工作流,支持 PII 数据脱敏、多语言 diarization 及实时语音机器人构建。开发者无需编写代码即可利用企业级语音 AI 模型驱动业务流程,大幅降低语音数据处理门槛。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-08-26 产品动态 | 版本升级 | 技术解读
官方原文

AssemblyAI 发布自动语言检测 2.0:支持 17 种语言并引入置信度阈值

AssemblyAI 于 2024 年 8 月 26 日重磅升级其自动语言检测(ALD)模型。此次更新将最佳服务等级(Best Tier)的语言支持从 7 种扩展至 17 种,新增包括中文、芬兰语和印地语等热门语种,并在 15 种语言中达到行业顶尖准确率。此外,平台引入了可定制的置信度阈值功能,赋予开发者对低置信度内容的精细控制能力,显著提升了多语言应用的可信度与灵活性。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-08-21 技术解读 | 模型原理 | LLM 进阶
官方原文

深度解析:LLM 解码策略如何决定文本生成的质量与速度

本文深入剖析大语言模型(LLM)从“概率预测”到“实际生成”的核心机制。文章区分了建模阶段与解码阶段,重点阐述了采样(Sampling)和 Token 选择策略(如 Greedy Search, Beam Search)如何影响输出的创造性、一致性与推理速度。对于开发者而言,理解这些底层逻辑是优化 Prompt Engineering 效果、提升特定任务(如代码生成 vs 创意写作)表现的关键。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-08-12 产品动态 | 版本升级 | 开发者工具
官方原文

AssemblyAI 发布 Ruby SDK:构建语音 AI 应用的新引擎

AssemblyAI 正式推出 Ruby SDK,旨在简化 Ruby 开发者集成其领先的语音 AI 模型。该工具支持音频转录、情感分析等音频智能功能,并可通过 LeMUR 轻松将大语言模型(LLM)应用于语音数据。此次发布标志着 AssemblyAI 在多语言开发支持上的重要进展,为构建自动化语音代理和智能客服系统提供了更便捷的底层能力。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-08-06 产品动态 | 版本升级 | 生态合作
官方原文

AssemblyAI 升级 Zapier 集成:解锁完整 API 功能与字幕生成能力

AssemblyAI 正式推出增强版 Zapier 应用,全面开放 API 功能至无代码工作流。此次更新不仅将语音识别、PII 数据脱敏等高级功能直接集成到 Zapier 编辑器,还新增了获取字幕、段落分割及句子提取等 5 个新事件。开发者与用户可借此实现更灵活的自动化转录与数据处理,无需编写代码即可调用核心 AI 能力。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-08-06 产品动态 | 生态合作 | 工作流自动化
官方原文

AssemblyAI 与 Zapier 深度集成:一键生成视频字幕与云端存储

AssemblyAI 正式推出 Zapier 官方应用,打通视频转录、字幕生成与云端存储的全流程。开发者可通过 Zapier 自动化工作流,利用 AssemblyAI 的 Voice AI 能力将视频 URL 自动转录为文本,并一键生成 SRT 格式字幕文件上传至 Google Drive。该集成极大简化了视频内容处理流程,实现了从音频/视频输入到结构化字幕输出的零代码自动化。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文