AssemblyAI 发布流式语音识别关键术语增强:实时精准捕捉核心词汇

ADK AssemblyAI官方 / ADK编译 2025-09-11 4 分钟 63 次浏览
速览导读 / Summary

AssemblyAI 正式推出 Keyterms Prompting 功能,针对流式语音识别(Streaming STT)中的领域专有名词(如产品名、人名、医学术语)进行实时增强。该功能允许用户传入最多 100 个自定义关键术语,显著提升特定词汇的识别准确率。相比行业基准 Deepgram Nova-3,关键术语识别准确率平均提升 21%,且仅增加$0.04/小时的费用,为语音 Agent 和会议转录等场景提供了高性价比的解决方案。

准确率提升幅度 21% 相比 Deepgram Nova-3 在关键术语上的平均提升
额外成本 $0.04/hour Keyterms Prompting 的每小时增量费用
支持术语数量 100 单次请求中可配置的最大关键术语数
成本节省率 67% 相比同类解决方案的总成本节省比例

Key Insights / 核心看点

  • 1 推出 Keyterms Prompting 功能,支持在流式语音识别中实时增强最多 100 个自定义关键术语的识别准确率。
  • 2 相比行业基准 Deepgram Nova-3,关键领域术语的识别准确率平均提升 21%,显著降低误识率。
  • 3 仅需$0.04/小时额外成本,相比竞品节省 67%,提供企业级精度与高性价比的平衡。
  • 4 完美适配餐饮、医疗、会议记录等对专有名词敏感的垂直行业场景,提升业务自动化水平。
  • 5 集成极其简单,通过 API 参数即可生效,无需复杂的模型微调或重新训练。

AssemblyAI 发布 Keyterms Prompting:流式语音识别的精准升级

在语音 AI 领域,通用模型往往难以应对行业特有的专有名词。无论是餐饮订单中的“Baconator”还是医疗日程中的“Dr. Rodriguez”,这些关键术语的误识会导致严重的业务后果:订单错误、会议记录不可检索,甚至医疗预约失误。

针对这一痛点,AssemblyAI 于 2025 年 9 月 11 日推出了 Keyterms Prompting 功能,专为 Universal-Streaming 模型设计。该功能允许开发者在流式语音识别请求中传入最多 100 个自定义关键术语,确保这些“最重要”的词汇被完美转录。

核心突破:领域专有名词的实时增强

传统的语音识别系统在处理领域特定语言(Domain-Specific Vocabulary)时面临巨大挑战。餐厅菜单、医疗术语、公司内部黑话等独特拼写和专有名词,往往是导致语音 Agent 失败的主要原因。

Keyterms Prompting 通过简单的参数注入(keyterms_prompt),无需复杂的微调(Fine-tuning)或昂贵的定制模型,即可在推理阶段动态提升特定词汇的置信度。

关键技术指标

  • 准确率提升:在关键领域术语上,相比 Deepgram Nova-3 基准模型,准确率平均提升 21%
  • 误识率降低:关键实体误识率(Missed Entity Rate, MER)显著下降,特别是在医疗对话和复杂菜单场景下。
  • 成本效益:额外费用仅为 $0.04/小时,相比同类解决方案节省 67% 的成本。
  • 参数限制:支持最多 100 个术语,单个术语长度不超过 50 字符。

多行业应用场景与价值

1. 餐饮服务:订单零误差

在食品服务行业,菜单项的准确性至关重要。将“Whopper”误听为“Wrapper”不仅造成订单错误,更会损害客户信任。Keyterms Prompting 可精准识别餐厅特定的菜单项、定制选项(如“extra crispy”)及内部术语,大幅减少重复确认和返单率。

2. 医疗健康:安全与专业

医疗调度机器人对医生姓名和医学术语的准确性要求极高。误识可能导致患者预约到错误的医生,存在潜在风险。该功能确保医生姓名、专科术语及诊所特定词汇的精确转录,保障预约流程的专业性与安全性。

3. 会议智能:可搜索的文档

会议转录的价值取决于其可检索性。当参与者姓名和公司缩写被混淆时,笔记将失去意义。通过动态注入会议开始时的关键人名和术语,Keyterms Prompting 确保了生成的文档不仅准确,而且完全可搜索。

极简集成,赋能规模化

实现 Keyterms Prompting 极为简便,开发者只需在流式请求配置中添加 keyterms_prompt 参数即可。该功能无缝集成于现有 API,支持从 100 小时到 10,000+ 小时/月的弹性计费模式。

正如 AssemblyAI 团队所言:

"Accurate transcription of your critical vocabulary shouldn't break your budget." (对您关键词汇的精准转录不应破坏您的预算。)

这一更新标志着语音 AI 从“通用理解”向“精准领域执行”的重要跨越,让语音 Agent 在处理复杂业务逻辑时更加可靠。

Accurate transcription of your critical vocabulary shouldn't break your budget.

AssemblyAI Product Marketing Team

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
产品动态 2026-09-06

Adobe Photoshop 与 Upscale.media 联手:AI 驱动图像超分辨率技术深度解析

Adobe Photoshop 与 AI 图像增强工具 Upscale.media 宣布深度整合,旨在为专业用户提供更高效的图像超分辨率解决方案。此次合作利用先进的 AI 算法,在不依赖复杂软件学习曲线的情况下,实现从低分辨率到高清图像的无损转换。文章详细阐述了该技术在保留细节、修复模糊以及支持多格式处理方面的核心优势,并展示了从上传到下载的完整操作流程,标志着图像增强领域向更智能化、便捷化方向迈出了重要一步。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Adobe Photoshop 2025 图像分辨率优化指南:超分辨率与智能放大技巧

Adobe Photoshop 2025 在图像分辨率处理上带来了显著优化,重点介绍了如何利用内置的“超分辨率”功能无损放大 JPEG 图像。本文详细解析了从基础图像尺寸调整到高级 Camera Raw 滤镜应用的完整流程,帮助设计师和摄影师在保持画质的前提下提升输出质量。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Upscale.media 发布智能图像增强方案:AI 驱动高清修复与细节重构

Upscale.media 推出全新图像增强指南,详解如何利用 AI 技术将低分辨率图片转化为高清视觉内容。文章解析了图像上采(Upscaling)的核心原理,涵盖分辨率、锐度、色彩准确性等关键质量指标,并展示了该工具在商业展示、印刷输出及个人创作中的实际应用价值,旨在帮助用户摆脱像素化困扰,实现无损画质提升。

Upscale.media官方 / ADK编译 4 分钟