DeepSeek Harness 引入 WaveSpeed 技能:构建多模态 AI 编排新范式
在 AI 智能体(Agent)生态日益复杂的今天,单一模型已难以满足企业级应用对多模态内容生成、复杂工作流编排及成本控制的需求。2026 年 8 月 19 日,DeepSeek 在其旗舰级智能体平台 DeepSeek Harness (dsh) 中正式推出了 WaveSpeed 技能 (Skill),旨在解决智能体在多模态任务执行中的“最后一公里”问题。
此次更新的核心在于将 WaveSpeed AI 的庞大模型库与 DeepSeek Harness 的编排引擎深度打通。开发者不再需要手动编写复杂的 API 调用代码,而是通过简单的技能配置,即可让智能体自主搜索模型目录、读取输入 Schema,并执行图像、视频、音频及 3D 生成任务。
核心突破:从单模态到全模态的无缝编排
WaveSpeed 技能的引入,打破了传统智能体仅能调用单一 LLM 的局限。它提供了一个标准化的接口,使智能体能够:
- 全模态模型调用:智能体可无缝调用包括 Wan-3-0, Flux-3, Kling-3-0, Gemini-4 等在内的数十种主流开源及闭源模型,覆盖图像生成、视频渲染、3D 建模及音频合成。
- 自动化工作流构建:结合 MCP (Model Context Protocol) 标准,开发者可以构建包含多步推理、多模态交互的复杂 Agent 工作流,例如“根据文本描述生成 3D 模型 -> 渲染视频 -> 生成解说音频”。
- 动态模型选择:智能体可根据任务需求,在后台自动匹配最合适的模型,无需人工干预。
关键价值:生产级的成本与效率管控
对于企业级应用而言,模型调用成本是核心考量因素。WaveSpeed 技能在此处展现了独特的架构优势:
- 实时价格检查 (Price Check):在每一次模型执行前,系统会自动查询并显示调用成本。这使得智能体在规划任务时,能够自动避开昂贵模型,优先选择性价比高的替代方案,实现真正的“按需付费”。
- Schema 驱动的执行:通过标准化的输入输出定义,大幅降低了调试难度,提升了工作流的稳定性和可维护性。
开发者与用户的实际应用价值
对于开发者,这意味着无需重新构建底层基础设施,即可快速构建具备多模态能力的智能体应用。对于最终用户,这意味着 AI 助手不仅能回答问题,还能直接生成高质量的视觉内容、视频素材甚至 3D 资产,极大地拓展了 AI 在内容创作、游戏开发、营销广告等场景的应用边界。
正如官方团队所言:"We are enabling agents to not just think, but to create and execute complex multi-modal workflows with full awareness of cost and capability."(我们正在让智能体不仅能思考,还能以完全的成本和能力意识来执行复杂的多模态工作流。)
这一更新标志着 DeepSeek Harness 正从单纯的对话平台,向全栈 AI 生产力工具演进,为构建下一代多模态智能体生态奠定了坚实基础。