Kimi 发布 K2 Thinking:测试时缩放与智能体推理的里程碑突破

ADK Kimi智能助手官方 / ADK编译 2026-07-13 5 分钟 149 次浏览
速览导读 / Summary

Kimi 正式推出 K2 Thinking,一款专为智能体设计的开源推理模型。该模型通过测试时缩放(Test-time Scaling)技术,在保持 INT4 量化高效推理的同时,实现了长达 200-300 步的工具调用与复杂任务规划。在 HLE、SWE-Bench 等权威基准测试中创下多项 SOTA 记录,显著提升了代码生成、深度搜索及长文本创作能力,标志着 AI 智能体从‘单步响应’向‘自主长期规划’的跨越。

HLE 基准得分 44.9% Humanity's Last Exam 智能体搜索与编程新纪录
BrowseComp 得分 60.2% 远超人类基准线 (29.2%),展现深度网页推理能力
SWE-Bench Verified 71.3% 代码修复与软件工程任务表现优异
最大连续工具调用 200-300 次 无需人类干预的自主长程规划能力
推理精度 INT4 通过 QAT 技术实现 2 倍生成速度提升

Key Insights / 核心看点

  • 1 推出 K2 Thinking 开源模型,通过测试时缩放(Test-time Scaling)技术,实现 200-300 步连续工具调用与长程规划。
  • 2 在 HLE、BrowseComp 等权威基准测试中刷新 SOTA 记录,HLE 得分达 44.9%,BrowseComp 得分达 60.2%。
  • 3 采用 Quantization-Aware Training (QAT) 技术,支持 INT4 量化推理,在保持高性能的同时实现 2 倍生成速度提升。
  • 4 显著增强代码生成与调试能力,在 SWE-Bench Verified 上得分 71.3%,能处理复杂前端与多语言开发任务。
  • 5 支持博士级数学问题求解,通过动态循环的‘思考 - 搜索 - 代码’模式解决跨学科难题。

Kimi 发布 K2 Thinking:测试时缩放与智能体推理的里程碑突破

7 月 13 日,Kimi 正式推出了其最新力作 Kimi K2 Thinking。这不仅仅是一次模型参数的更新,更是 Kimi 在 Test-time Scaling(测试时缩放) 领域的重大突破。作为目前最强大的开源推理模型之一,K2 Thinking 被设计为一个具备自主规划能力的 Thinking Agent,能够在无需人类干预的情况下,通过数百个步骤的连续工具调用来解决极其复杂的跨学科问题。

核心突破:测试时缩放与高效推理

K2 Thinking 的核心创新在于将推理能力与工具调用深度结合。不同于传统模型仅依赖上下文窗口,K2 Thinking 通过 Scaling both thinking tokens and tool calling steps(同时扩展思考令牌和工具调用步骤),实现了真正的长程规划。

  • 超长序列执行:模型能够连续执行 200–300 次工具调用,在“思考 - 搜索 - 代码 - 验证”的动态循环中保持逻辑连贯性。
  • INT4 量化加速:针对推理模型通常因解码长度过长而导致量化效果不佳的痛点,Kimi 采用了 Quantization-Aware Training (QAT) 技术。通过 INT4 权重量化 MoE 组件,K2 Thinking 在保持 SOTA 性能的同时,实现了 2 倍的生成速度提升,大幅降低了 GPU 显存占用。

性能实测:多项基准测试刷新纪录

Humanity's Last Exam (HLE)BrowseCompSWE-Bench Verified 等严苛基准测试中,K2 Thinking 展现了卓越的多领域专家级推理能力:

基准测试 得分 关键表现
HLE (Humanity's Last Exam) 44.9% 覆盖 100+ 学科,创下智能体搜索与编程新纪录
BrowseComp 60.2% 远超人类基准线 (29.2%),擅长深度网页信息检索
SWE-Bench Verified 71.3% 代码修复与软件工程任务表现优异
SWE-Multilingual 61.1% 多语言代码生成能力强劲

应用场景与能力进化

K2 Thinking 的能力不仅体现在分数上,更体现在解决实际问题的深度:

1. 深度代码开发与调试

模型能够处理复杂的 HTML、React 及组件密集型的前端任务。在智能体编程模式下,它能将抽象需求转化为可交互的产品原型,并流畅地集成到软件代理中执行多步开发工作流。

2. 自主搜索与问题解决

BrowseComp 测试中,K2 Thinking 展示了其 Goal-directed, web-based reasoning(目标导向的网页推理)能力。面对模糊的开放性问题,它能将其分解为可执行的子任务,通过动态的 think → search → browser use 循环,最终给出严谨的答案。例如,它曾成功通过 23 次交错推理和工具调用 解决了一个 博士级别的数学问题

3. 创意与实用写作增强

  • 创意写作:文本风格更加生动,意象更具深度,故事和剧本更具人性与情感共鸣。
  • 实用写作:在学术研究和长文分析中,逻辑更加严密,指令遵循度更高,能够系统地覆盖每一个要求点。

生态落地

Kimi K2 Thinking 现已在 kimi.ai 的聊天模式中上线,并开放了 API 接口。随着全功能智能体模式(Full Agentic Mode)的即将推出,开发者们可以利用这一强大的推理引擎,构建具备长期记忆、自主规划和复杂工具使用能力的下一代 AI 应用。

"K2 Thinking marks our latest efforts in test-time scaling, by scaling both thinking tokens and tool calling steps." — Kimi 官方团队

Kimi K2 Thinking 的发布,标志着 AI 智能体正从简单的指令执行者,进化为能够独立处理复杂、长程任务的通用问题解决专家。

K2 Thinking marks our latest efforts in test-time scaling, by scaling both thinking tokens and tool calling steps.

Kimi 官方团队

同主题深度资讯

查看更多 →
AI 工具 2026-09-07

WatermarkRemover 发布全新 AI 去水印工具:一键清除多水印,保留原图画质

WatermarkRemover 正式推出基于先进 AI 技术的免费图像去水印解决方案。该工具通过自动检测与智能修复技术,支持批量移除多色水印,同时保留图像原始质量。无需专业修图技能,用户即可在数秒内完成去水印操作,并支持批量处理,极大提升了内容创作者与商业用户的效率。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 发布:AI 驱动的高效去水印工具,重塑图像版权与分享体验

WatermarkRemover 推出全新 AI 驱动的去水印解决方案,旨在解决传统裁剪法无法保留原图质量及水印影响专业度的痛点。该工具无需安装,支持一键上传与自动检测,承诺在去除水印的同时完美保留图像分辨率与细节。文章强调,去除水印不仅是技术操作,更是保护摄影师声誉、提升社交媒体互动率及避免版权纠纷的关键策略。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 2025 版上线:AI 驱动一键去除 TikTok 水印,助力创作者跨平台分发

WatermarkRemover 于 2025 年推出全新 TikTok 水印去除功能,利用先进的 AI 图像修复与视频处理技术,帮助用户轻松移除嵌入的视频水印。该工具支持直接粘贴 URL 即可一键处理,解决了创作者在 Instagram Reels 等平台上分发内容时的合规与美观难题。核心亮点包括智能背景重构、无损画质保留及极速处理速度,显著提升了内容再创作效率。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 上线:AI 驱动一键清除截图水印,重塑图像纯净度

WatermarkRemover 正式推出全新 AI 驱动的水印移除功能,专为处理截图与照片设计。通过先进的图像分析与内容重构算法,用户无需专业修图技能即可一键清除复杂水印。该工具主打免费、高效与高保真输出,显著降低了图像去水印的技术门槛,为内容创作者与开发者提供了便捷的图像净化方案。

WatermarkRemover官方 / ADK编译 3 分钟
chat · 免费+付费
★ 5.0 · 120评测
K

Kimi智能助手

月之暗面推出的AI智能助手

Kimi智能助手是北京月之暗面推出的AI智能助手,支持联网搜索能力,可实时获取最新信息结合搜索结果为用户提供准确且详细的回答。支持多种文件格式(如PDF、Word、Excel、PPT等),能帮助用户快速整理和提取关键信息。Kimi智能助手具备长文本处理能力,最高支持200万字的输入和输出,适合处理复杂的长篇内容。 k2.5:月之暗面开源的全新一代全能旗舰模型,具备顶尖的代码生成、视觉理解能力,支持自主 Agent 集群协作 k2:月之暗面Kimi推出的具备超强代码和 Agent 能力的 MoE 架构基础模型,发布即开源。 k1.5:月之暗面Kimi推出的多模态思考模型,具备强大的推理和多模态处理能力。 用户可以通过网页端、手机端APP或浏览器插件使用Kimi智能助手。具备Kimi探索版和Kimi+等特色功能,能满足用户在不同场景下的多样化需求。

查看 Kimi智能助手 使用教程与功能