AssemblyAI 发布 Keyterms Prompting:流式语音识别的精准升级
在语音 AI 领域,通用模型往往难以应对行业特有的专有名词。无论是餐饮订单中的“Baconator”还是医疗日程中的“Dr. Rodriguez”,这些关键术语的误识会导致严重的业务后果:订单错误、会议记录不可检索,甚至医疗预约失误。
针对这一痛点,AssemblyAI 于 2025 年 9 月 11 日推出了 Keyterms Prompting 功能,专为 Universal-Streaming 模型设计。该功能允许开发者在流式语音识别请求中传入最多 100 个自定义关键术语,确保这些“最重要”的词汇被完美转录。
核心突破:领域专有名词的实时增强
传统的语音识别系统在处理领域特定语言(Domain-Specific Vocabulary)时面临巨大挑战。餐厅菜单、医疗术语、公司内部黑话等独特拼写和专有名词,往往是导致语音 Agent 失败的主要原因。
Keyterms Prompting 通过简单的参数注入(keyterms_prompt),无需复杂的微调(Fine-tuning)或昂贵的定制模型,即可在推理阶段动态提升特定词汇的置信度。
关键技术指标
- 准确率提升:在关键领域术语上,相比 Deepgram Nova-3 基准模型,准确率平均提升 21%。
- 误识率降低:关键实体误识率(Missed Entity Rate, MER)显著下降,特别是在医疗对话和复杂菜单场景下。
- 成本效益:额外费用仅为 $0.04/小时,相比同类解决方案节省 67% 的成本。
- 参数限制:支持最多 100 个术语,单个术语长度不超过 50 字符。
多行业应用场景与价值
1. 餐饮服务:订单零误差
在食品服务行业,菜单项的准确性至关重要。将“Whopper”误听为“Wrapper”不仅造成订单错误,更会损害客户信任。Keyterms Prompting 可精准识别餐厅特定的菜单项、定制选项(如“extra crispy”)及内部术语,大幅减少重复确认和返单率。
2. 医疗健康:安全与专业
医疗调度机器人对医生姓名和医学术语的准确性要求极高。误识可能导致患者预约到错误的医生,存在潜在风险。该功能确保医生姓名、专科术语及诊所特定词汇的精确转录,保障预约流程的专业性与安全性。
3. 会议智能:可搜索的文档
会议转录的价值取决于其可检索性。当参与者姓名和公司缩写被混淆时,笔记将失去意义。通过动态注入会议开始时的关键人名和术语,Keyterms Prompting 确保了生成的文档不仅准确,而且完全可搜索。
极简集成,赋能规模化
实现 Keyterms Prompting 极为简便,开发者只需在流式请求配置中添加 keyterms_prompt 参数即可。该功能无缝集成于现有 API,支持从 100 小时到 10,000+ 小时/月的弹性计费模式。
正如 AssemblyAI 团队所言:
"Accurate transcription of your critical vocabulary shouldn't break your budget." (对您关键词汇的精准转录不应破坏您的预算。)
这一更新标志着语音 AI 从“通用理解”向“精准领域执行”的重要跨越,让语音 Agent 在处理复杂业务逻辑时更加可靠。