InfCode 刷新 SWE-Bench Verified 世界最佳,开启 AI 编程智能体新纪元
近日,词元无限(Tokfinity)与北京航空航天大学复杂关键软件环境全国重点实验室联合发布的 AI 编程智能体 InfCode,在业界权威基准 SWE-Bench Verified 上取得了 79.4% 的 Pass@1 得分。这一成绩不仅刷新了当前的 SOTA(State-of-the-Art)记录,更远远领先于 GPT-5、Claude 等公开排行榜上的顶尖模型(约 65%),标志着 AI 编程正式从“代码片段生成”迈向“全流程自主工程修复”的新阶段。
01 突破系统语言瓶颈:C++ 修复率领跑
传统大模型在 Python 等高级语言上表现尚可,但在涉及内存管理、模板机制和复杂编译链的 C++、Rust 等系统语言上往往力不从心。Multi-SWE-bench 数据显示,C++ 项目通常涉及跨文件、大规模修改(单次修改超 200 行,涉及 7 个文件),导致主流模型解决率不足 8%。
InfCode 在 C++ 子集上取得了 25.58% 的 Pass@1 解决率,展现了其在复杂系统代码中的卓越能力。这得益于其独特的代码意图分析(Code Intent Analysis)机制,能够超越传统的字面匹配,理解自然语言描述背后的功能语义,并精准映射到具体的实现单元(函数或类),从而在无堆栈追踪的情况下直达根因代码。
02 三大核心突破:从“盲搜”到“精准手术”
InfCode 之所以能实现如此高的修复成功率,主要归功于以下三大技术突破:
1. 超越 RAG:基于功能意图的复杂上下文定位
传统基于向量相似度的检索(RAG)往往只能找到包含关键词的注释或变量,容易停留在“字面相关”而非“逻辑归属”的层面。InfCode 通过融合语义推理与架构理解,让智能体具备“理解全局意图、直达根因代码”的能力,解决了在大型工程中定位问题代码的痛点。
2. 增强工具:基于 AST 的结构化检索
针对 C++ 等语言中同一标识符可能代表类名、函数或变量的歧义问题,InfCode 自研了基于抽象语法树(AST)的结构化检索引擎。它利用 Tree-Sitter 构建完整语法树,提供 FindClass、FindFunction 等语法层 API,实现了真正的“语法感知搜索”,避免了传统 Grep 的高噪声问题。
3. 多智能体生成:对抗式双智能体闭环
InfCode 摒弃了传统的单智能体单向修复模式,首创对抗式双智能体架构:
- 代码补丁生成器:负责修改代码以通过测试集。
- 测试补丁生成器:负责生成更强的测试用例,捕捉边界场景。 两者在闭环中交替迭代,形成“越测越强、越修越稳”的进化机制,确保补丁具备生产级别的鲁棒性与完备性。
03 工程化细节:生成与筛选的双重保障
在实际工程落地中,InfCode 采用了严谨的两阶段修复流程:
- 生成阶段(Generate):并行启动多个独立容器,运行修复链路,最多经历五轮迭代,产生多样化的候选补丁组合。
- 筛选阶段(Select):在真实构建和测试环境中重放每个补丁,不仅验证测试通过,还评估行为一致性、稳定性和副作用,最终选出质量最高的修复方案。
这种“广泛探索 + 精准筛选”的策略,有效防止了模型过拟合或生成脆弱修改,使其产出可直接集成于生产仓库的工程级补丁。
结语:从单体提效到组织进化
InfCode 的成功不仅是算法模型的胜利,更是 AI 编程范式的变革。正如官方团队所言,这代表了 AI 从“单体提效”走向企业“组织进化”的新范式。对于希望在企业场景引入 AI Coding 的决策者而言,InfCode 展示了智能体在复杂软件工程中自主规划、工具调用与自我修正的完整能力,为构建下一代可信、高效的智能软件环境奠定了坚实基础。
更多技术细节可参考团队发表于 arXiv 的最新报告: