Kimi K2.5:视觉智能体群与代码视觉化双重突破
今天,Kimi 正式推出了其迄今为止最强大的开源模型——Kimi K2.5。该模型基于约 15T 混合视觉与文本 token 的持续预训练构建,作为原生多模态模型,它在代码生成、视觉理解以及自主智能体群(Agent Swarm)调度方面实现了多项突破性进展。
核心突破:视觉智能体群(Visual Agentic Intelligence)
Kimi K2.5 的核心创新在于其“自导向智能体群”范式。与传统的单智能体模式不同,K2.5 能够自主调度一个包含多达 100 个子智能体的集群,执行跨越1,500 个工具调用的并行工作流。
- 效率飞跃:相比单智能体设置,这种并行执行模式将任务完成时间缩短了4.5 倍。
- 零预设架构:智能体群由 Kimi K2.5 自动创建和编排,无需预先定义子智能体角色或手工编写工作流。
- 技术原理:模型采用并行智能体强化学习(PARL)训练,通过可训练的编排器智能体将任务分解为并行子任务。为克服“串行崩溃”(即编排器默认退化为单智能体执行)和“虚假并行”(无意义地生成大量子智能体)问题,PARL 引入了分阶段奖励塑形机制,平衡并行度与任务成功率。
代码与视觉的深度融合
Kimi K2.5 是迄今为止最强的开源代码模型,尤其在前端开发和视觉代码生成方面表现卓越。
- 从对话到界面:模型能将简单的对话转化为包含交互布局和丰富动画(如滚动触发效果)的完整前端界面。
- 视觉驱动编程:通过推理图像和视频,K2.5 显著提升了从视觉输入到代码的生成能力,并支持自主视觉调试。它能像人类一样观察代码输出,利用视觉输入和文档查找进行自我迭代,实现端到端的艺术风格网页生成。
- 全能代码能力:在涵盖构建、调试、重构、测试等全生命周期的内部基准测试中,K2.5 相比 K2 版本展现了一致且显著的性能提升。
生态落地与工具链
Kimi K2.5 已全面开放,支持多种接入方式:
- 多模式体验:Kimi.ai 及 Kimi App 现已支持四种模式:K2.5 Instant(即时)、K2.5 Thinking(思考)、K2.5 Agent(智能体)及 K2.5 Agent Swarm(智能体群,目前为 Beta 版)。
- Kimi Code:专为软件工程师打造的终端工具,支持 VSCode、Cursor 等主流 IDE 集成。Kimi Code 不仅支持图像和视频输入,还能自动发现并迁移现有的技能(Skills)和模型上下文协议(MCPs)至工作环境中。
- 成本优势:在 HLE、BrowseComp 和 SWE-Verified 三大智能体基准测试中,K2.5 以远低于传统方案的成本交付强劲性能。
“Kimi K2.5 标志着我们从单纯向上堆叠模型参数,转向了自导向、协调的群智能执行新范式。” —— Kimi 官方团队
对于开发者而言,Kimi K2.5 不仅是一个强大的生成式模型,更是一个能够自主规划、并行执行复杂任务的智能协作系统,极大地降低了构建复杂 AI 应用的门槛。