Krisp 宣布通过启用 FP16(半精度浮点数)执行模式,在不改变模型架构的前提下,显著提升了语音隔离算法的服务器并发处理能力。在 AWS Graviton3 和 Intel Sapphire Rapids 等支持 FP16 的 CPU 上,单台 16 核服务器处理的实时通话数量从 76 路提升至 137 路,增幅达 2 倍。该优化通过减少内存带宽占用和提升指令级吞吐量实现,为大规模部署的 AI 语音代理提供了极具价值的性能提升方案。
并发通话数提升
2x
在 Graviton3 上从 76 路增至 137 路
单帧处理耗时
1.48 ms
20ms 音频帧的清洁处理时间,较 FP32 模式优化明显
架构变更
0
无需模型重训或代码重构,仅需开启配置开关
Krisp 发布 CPU 优化突破:开启 FP16 执行模式使并发语音代理处理量翻倍
更新背景
在 AI 语音代理(Voice AI Agents)大规模部署的场景中,语音隔离(Voice Isolation)是核心功能之一。然而,每一通通话都会消耗服务器的 CPU 资源。当并发通话量达到数千级时,CPU 资源瓶颈往往导致帧丢失、延迟增加甚至服务中断。
Krisp 团队在探索如何最大化单台服务器的处理能力时,提出了一个关键问题:在保持音质无损的前提下,如何在不更换模型或重构管道(pipeline)的情况下,提升服务器的并发承载上限?经过深入分析,他们发现了一个被忽视的关键变量——数据精度。