Kimi 发布 K2 Thinking:测试时缩放与智能体推理的里程碑突破
7 月 13 日,Kimi 正式推出了其最新力作 Kimi K2 Thinking。这不仅仅是一次模型参数的更新,更是 Kimi 在 Test-time Scaling(测试时缩放) 领域的重大突破。作为目前最强大的开源推理模型之一,K2 Thinking 被设计为一个具备自主规划能力的 Thinking Agent,能够在无需人类干预的情况下,通过数百个步骤的连续工具调用来解决极其复杂的跨学科问题。
核心突破:测试时缩放与高效推理
K2 Thinking 的核心创新在于将推理能力与工具调用深度结合。不同于传统模型仅依赖上下文窗口,K2 Thinking 通过 Scaling both thinking tokens and tool calling steps(同时扩展思考令牌和工具调用步骤),实现了真正的长程规划。
- 超长序列执行:模型能够连续执行 200–300 次工具调用,在“思考 - 搜索 - 代码 - 验证”的动态循环中保持逻辑连贯性。
- INT4 量化加速:针对推理模型通常因解码长度过长而导致量化效果不佳的痛点,Kimi 采用了 Quantization-Aware Training (QAT) 技术。通过 INT4 权重量化 MoE 组件,K2 Thinking 在保持 SOTA 性能的同时,实现了 2 倍的生成速度提升,大幅降低了 GPU 显存占用。
性能实测:多项基准测试刷新纪录
在 Humanity's Last Exam (HLE)、BrowseComp 和 SWE-Bench Verified 等严苛基准测试中,K2 Thinking 展现了卓越的多领域专家级推理能力:
| 基准测试 | 得分 | 关键表现 |
|---|---|---|
| HLE (Humanity's Last Exam) | 44.9% | 覆盖 100+ 学科,创下智能体搜索与编程新纪录 |
| BrowseComp | 60.2% | 远超人类基准线 (29.2%),擅长深度网页信息检索 |
| SWE-Bench Verified | 71.3% | 代码修复与软件工程任务表现优异 |
| SWE-Multilingual | 61.1% | 多语言代码生成能力强劲 |
应用场景与能力进化
K2 Thinking 的能力不仅体现在分数上,更体现在解决实际问题的深度:
1. 深度代码开发与调试
模型能够处理复杂的 HTML、React 及组件密集型的前端任务。在智能体编程模式下,它能将抽象需求转化为可交互的产品原型,并流畅地集成到软件代理中执行多步开发工作流。
2. 自主搜索与问题解决
在 BrowseComp 测试中,K2 Thinking 展示了其 Goal-directed, web-based reasoning(目标导向的网页推理)能力。面对模糊的开放性问题,它能将其分解为可执行的子任务,通过动态的 think → search → browser use 循环,最终给出严谨的答案。例如,它曾成功通过 23 次交错推理和工具调用 解决了一个 博士级别的数学问题。
3. 创意与实用写作增强
- 创意写作:文本风格更加生动,意象更具深度,故事和剧本更具人性与情感共鸣。
- 实用写作:在学术研究和长文分析中,逻辑更加严密,指令遵循度更高,能够系统地覆盖每一个要求点。
生态落地
Kimi K2 Thinking 现已在 kimi.ai 的聊天模式中上线,并开放了 API 接口。随着全功能智能体模式(Full Agentic Mode)的即将推出,开发者们可以利用这一强大的推理引擎,构建具备长期记忆、自主规划和复杂工具使用能力的下一代 AI 应用。
"K2 Thinking marks our latest efforts in test-time scaling, by scaling both thinking tokens and tool calling steps." — Kimi 官方团队
Kimi K2 Thinking 的发布,标志着 AI 智能体正从简单的指令执行者,进化为能够独立处理复杂、长程任务的通用问题解决专家。