RESEMBLE.AI 发布实时语音检测技术:破解 AI 语音克隆与实时转换
背景:AI 语音成为新型社会工程学武器
2026 年 4 月,Charter Communications 遭遇了一起典型的 AI 驱动诈骗案。攻击者利用 AI 语音代理冒充 IT 支持人员,骗取员工 Microsoft Entra ID 凭证,进而入侵 Salesforce 系统并泄露 4000 万客户数据。威胁情报机构 EclecticIQ 披露,此类攻击背后是名为 ShinyHunters 的组织,他们利用 AI 语音代理在 ADT、7-Eleven、Medtronic 等大型企业间大规模实施“钓鱼”攻击。
这些案例凸显了一个紧迫问题:如何在实时通话中检测 AI 生成的语音? 传统的 STIR/SHAKEN 认证仅能验证来电者身份,却无法判断声音是否真实。RESEMBLE.AI 提出了一套全新的检测架构,旨在填补这一安全空白。
核心突破:覆盖全谱系的 DETECT-World 架构
RESEMBLE.AI 将 AI 语音攻击划分为三类,并针对其信号特征设计通用检测模型:
- 固定语音 TTS (Fixed-voice TTS):使用默认文本生成语音,无真人参与。此类攻击最易被检测,因为缺乏真实人的声纹特征。
- 语音克隆 TTS (Voice-cloned TTS):仅需少量样本即可模仿特定真人声音。这是 Charter 和 ADT 攻击的主要手段,检测难度较高。
- 实时语音转换 (Real-time voice conversion):真人说话时实时改变音色。由于保留了真人的韵律和呼吸,此类攻击最难被传统模型识别。
RESEMBLE.AI 的 DETECT-World 模型不再依赖记忆特定生成器的指纹,而是学习生成架构在音频频率和时间结构上留下的结构性模式。这使得单一模型能够泛化至所有三类攻击,包括从未见过的生成器。
技术实现:信任栈与毫秒级响应
检测并非单一模型的任务,而是由多层证据构成的“信任栈”:
- 检测层 (Detection):Resemble Detect 直接读取波形,独立输出 AI 生成概率分数,不依赖元数据。
- 可解释性层 (Explainability):Resemble Intelligence 将分数转化为法医报告,识别具体伪影、欺诈类型及说话人语境(语言、方言)。
- 身份匹配层 (Identity):结合已注册的声纹库,确认声音归属。
在部署模式上,系统支持两种生产级方案:
- 通话中流式检测 (In-call streaming):每 4 秒窗口分析,300 毫秒内给出结论,支持实时阻断或转人工。
- 通话后审计 (Post-call audit):对完整录音进行聚合分析,降低误报率。
实测指标与价值
在测试中,RESEMBLE.AI 在五种 PSTN 编码格式下表现卓越:
- 主流编码 (G.711, G.722):真实与合成音频准确率均达 100%。
- 压缩编码 (G.728, iLBC):准确率保持在 91% 以上。
“我们的目标不是仅仅识别已知的生成器,而是理解生成架构本身留下的痕迹。” —— RESEMBLE.AI 技术团队
该方案要求与通话录音相同的用户授权合规性,并作为 STIR/SHAKEN 的有效补充,为金融、电信和客服行业提供了应对 AI 诈骗的坚实防线。
应用价值
对于开发者而言,RESEMBLE.AI 提供了开箱即用的 API 和详细的 forensic 报告,便于集成到现有的呼叫中心系统中。对于企业用户,这意味着在毫秒级时间内识别并拦截潜在的 AI 诈骗电话,保护客户数据与品牌声誉。