AssemblyAI 发布 Universal-3.5 Pro:原生支持 18 语种代码切换与高精度说话人分离
7 月 7 日,语音识别巨头 AssemblyAI 宣布推出其最新旗舰异步语音转写模型——Universal-3.5 Pro。该模型专为应对现实世界音频的复杂性而设计,核心突破在于原生支持代码切换(Code-Switching)与说话人分离(Speaker Diarization)的联合优化,彻底改变了传统 STT 系统在处理多语种混合对话时的局限性。
核心突破:原生代码切换与多语言支持
在传统的语音转写系统中,代码切换通常被视为边缘案例。大多数模型被迫将对话强制归一化为单一语言,导致混合语种(如英印双语、法英混合)的对话出现严重误译或信息丢失。
Universal-3.5 Pro 摒弃了这种“一刀切”的策略,实现了原生代码切换:
- 18 语种无缝切换:模型内置了 18 种语言的支持,能够根据说话人实际使用的语种实时转录,无需额外的配置或后处理步骤。
- 上下文感知能力:模型能够理解语言切换背后的语义逻辑。例如,在英印双语对话中,当说话人从英语切换到印地语时,模型能准确捕捉到语法标记(如“了”字)所蕴含的时间状态变化,而非像竞品那样将其简单翻译为英文。
- 基准测试表现:在代码切换音频的归一化词错误率(Normalized WER)测试中,Universal-3.5 Pro 在平均 WER 上达到了 7.69%,显著优于 Deepgram Nova-3 Multilingual (12.22%)、ElevenLabs Scribe v2 (8.77%) 以及 OpenAI GPT-4o Transcribe (44.58%)。
技术革新:联合建模实现精准说话人分离
说话人分离(Diarization)长期以来是语音识别的“事后补充”,通常独立于转写系统运行,仅通过时间戳对齐来标注说话人。这种分离式架构在处理重叠语音、打断和快速轮转时往往失效。
Universal-3.5 Pro 采用了联合建模(Joint Modeling)架构,将“说什么”与“谁在说”整合在同一个模型中:
- 端到端标注:模型直接输出带说话人标签的转录文本,而非先转写再标注。
- 捕捉复杂交互:能够精准识别短轮次对话、快速来回应答以及重叠语音,避免了传统方法中句子被错误分割或归因的问题。
- 业务价值:在呼叫中心场景中,这一特性对于区分客服与客户的意图、分析情绪交互至关重要。相比仅依赖时间区域(DER)的传统指标,Universal-3.5 Pro 采用了结合转写准确率与说话人归因的综合评估体系,在真实通话数据中展现了更高的可靠性。
实际应用价值
对于开发者而言,Universal-3.5 Pro 降低了多语种会议记录与客服质检的门槛。企业无需再维护复杂的混合语种规则引擎或外挂的说话人分离模块,即可直接获得高质量、带说话人标签的原始对话数据。这对于需要处理全球多语言客户、跨国会议记录以及高噪音环境下的语音分析场景具有极高的实用价值。
“Universal-3.5 Pro 是专门为现实世界音频设计的,它原生处理代码切换,将说话人分离与转写整合为单一模型,从而捕捉到真实对话的完整复杂性。” —— AssemblyAI 团队
关键指标总结
| 指标 | 值/描述 | 备注 |
|---|---|---|
| 支持语种 | 18 种 | 原生代码切换支持 |
| 平均 WER (代码切换) | 7.69% | 优于竞品约 30%-40% |
| 架构类型 | 异步 (Async) | 联合建模 (Joint Modeling) |
| 输出特性 | 说话人标注转录 | 无需后处理对齐 |
AssemblyAI 表示,随着模型在代码切换和说话人分离上的持续迭代,Universal-3.5 Pro 将成为处理复杂多语种语音任务的首选方案。