AssemblyAI 发布 Dictation API:专为语音输入优化的智能纠错与格式重构引擎
在语音输入应用中,用户往往面临尴尬的“逐字记录”困境:犹豫的“um”、中途改口的句子、以及拼写错误的名字,都会原封不动地出现在最终文本中。AssemblyAI 今天正式推出了 Dictation API,这是其首款专为语音输入(Dictation)场景而生的 API,旨在解决从“听到”到“发送”之间的最后一公里问题。
核心突破:从逐字转录到智能直达
传统的语音识别(STT)模型设计初衷是“逐字记录”,它们追求高准确率地复现每一个发音,但这恰恰是语音输入应用的大忌。Dictation API 基于 AssemblyAI 旗舰模型 Universal-3.5 Pro,在保留用户语气和风格的同时,执行了深度的语义理解与文本重构。
三大核心能力
-
自我修正与填充词过滤 当用户在说话过程中改变主意(例如:"ship it tuesday no wait wednesday"),Dictation API 能智能识别并保留最终意图("Ship it Wednesday"),同时自动过滤掉"um"、"uh"等填充词,但保留用户的说话节奏和语调。
-
专有名词拼写校正 针对用户关心的特定名称(如同事名字、产品名、内部术语),开发者可通过
keyterms_prompt参数引导模型。即使模型未见过该名称,也能优先匹配用户输入的拼写,避免通用模型常见的拼写错误。 -
动态格式重构 通过
llm_instruction参数,开发者可以指定输出格式。例如,将一段口语指令自动转换为待办事项列表(Bullet points),或提取关键步骤,完全适配 Slack、CRM 或医疗记录等特定应用场景。
技术架构与性能指标
Dictation API 并非简单的后处理脚本,而是深度集成了 LLM 指令微调能力。
- 底层模型:运行在 Universal-3.5 Pro 之上,该模型在独立基准测试中排名第一,具备极高的基础准确率。
- 多语言支持:覆盖 19 种语言,满足全球化团队需求。
- 极致低延迟:针对短音频片段,平均响应时间(Time to finished text)低至 0.36 秒。API 支持流式分片上传,用户松开按键后大部分内容已处理完毕。
- 容错机制:请求限制为 5 秒,超时不会报错,而是返回原始文本并标记
llm_error: "timeout",确保用户体验流畅。
开发者价值与应用场景
对于构建语音输入应用的团队,Dictation API 将原本复杂的 NLP 任务(如意图识别、实体对齐、文本清洗)封装为单一请求。开发者只需关注业务逻辑,无需自行训练针对特定领域的纠错模型。
“我们构建 Dictation API,是因为一个错误的单词是不可挽回的,而格式错误是可以修正的。我们的目标是将用户的语音意图无损地转化为可发送的文本。” —— AssemblyAI 团队
该 API 现已开放,开发者可使用现有 API Key 免费试用,迅速集成到即时通讯、会议记录或智能客服等场景中。