InfCode 官方最新动态:InfCode 在 SWE‑Bench Verified 上获世界最佳
来源:InfCode 官方动态 | 发布日期:2025-10-01T00:00:00.000Z
核心更新概览
近日,词元无限研发团队与北京航空航天大学(以下简称“北航”)复杂关键软件环境全国重点实验室合作研发的智能体 InfCode 在 SWE‑Bench Verified 上,以 79.4% 的 Pass@1 得分刷新 SOTA(世界最佳)——远高于公开排行榜上 GPT‑5、Claude 等顶尖模型 65% 左右的成绩。
详细内容记录
近日,词元无限研发团队与北京航空航天大学(以下简称“北航”)复杂关键软件环境全国重点实验室合作研发的智能体 InfCode 在 SWE‑Bench Verified 上,以 79.4% 的 Pass@1 得分刷新 SOTA(世界最佳)——远高于公开排行榜上 GPT‑5、Claude 等顶尖模型 65% 左右的成绩。 这些数字背后,是一套面向企业场景设计的多智能体体系。对于希望在企业场景引入 AI Coding 的决策者而言,这是 AI 从「单体提效」走向企业「组织进化」的新范式。 传统的大模型只能生成代码片段,而新一代编码智能体(Coding Agent)强调自主性、全流程覆盖和工程实用性。它们不仅会写代码,还能分解任务、调用工具、运行测试、反复调试,甚至提交补丁。这些智能体在多个基准上接受评测,其中最具权威的是由普林斯顿大学等提出的 SWE‑Bench 基准,以及 OpenAI 于 2024 年发布的升级版 SWE‑Bench Verified。该基准来自真实 GitHub 项目,每个样本附带自然语言问题描述和完整的测试用例,要求智能体既要解决问题,又不能破坏其他功能。 SWE‑Bench Verified 仅包含 Python 项目,无法反映多语言生态的挑战。2025 年,字节跳动联合科研机构推出了 Multi‑SWE‑bench 数据集,覆盖 Java、TypeScript、JavaScript、Go、Rust、C 与 C++ 等七种语言,共计 1632 个经过人工验证的修复任务,由 68 名专家从 2456 个候选样本中精挑细选。 研究表明,C++ 项目通常需要一次修改 200 多行、涉及 7 个文件,这远难于 JavaScript 等高层语言;系统语言由于手动内存管理与复杂的编译体系使得 LLM 表现显著降低。对比官方报告,领先模型在 C++ 上的解决率往往不足 8%。 02 从学术走向工业:词元无限×北航——打造 InfCode 智能体 多语言基准显示,系统语言(C、C++、Rust)在内存管理、模板机制和复杂编译链方面的难度远高于 Python、Java 等高级语言。Multi‑SWE‑bench 中,C++ 问题往往涉及跨文件、大规模修改,部分任务需要改动 200 多行代码。 下表总结了 Multi‑SWE‑bench 各模型在 C++ 上的解决率:
更多技术细节可访问官方原文:https://www.tokensinfinity.com/blog/infcode?backPath=/blog。