DeepSeek V4.1 Flash:架构革新引领低成本智能新纪元
今天,DeepSeek 正式推出了其全新模型系列中的最小尺寸模型——DeepSeek V4.1 Flash。作为首个具备原生多模态视觉理解能力的轻量级模型,V4.1 Flash 不仅重新定义了大模型的成本效益比,更在推理速度与吞吐能力上实现了显著突破。
非对称架构:小成本撬动大智能
DeepSeek V4.1 Flash 采用了革命性的Causal-Encoder-Decoder结构。这种非对称设计打破了传统模型输入与输出激活对称的惯例,将输入激活限制在8B,而输出激活扩展至16B。这一架构创新使得模型在保持 552B 参数总量的同时,显著降低了计算成本,使其在同等规模下优于已知的所有同尺寸模型。
此外,该模型结合了新的预训练策略与更大规模的强化学习后训练(RLHF),在多项基准测试中成功超越了包括 DeepSeek V4 Pro 在内的旗舰模型,证明了架构优化与训练策略的协同效应。
极致压缩:大幅降低 Agent 类任务成本
针对当前 AI 应用中最耗资源的 KV Cache(键值缓存)问题,V4.1 Flash 实现了惊人的压缩效果。与上一代模型相比,其对 HBM(高带宽内存)的需求减少至1/4,对 SSD(固态硬盘)的需求减少至1/8。在 Agent(智能体)应用场景中,缓存命中成本往往占据主导,这一优化直接大幅降低了 Agent 类任务的运行成本。
数据显示,相对于初代模型,V4.1 Flash 的 KV Cache 体积已缩小至原来的1/437,为大规模并发推理提供了坚实的硬件基础。
生态与定价:全面赋能开发者
- API 服务升级:V4.1 Flash 已同步上线 DeepSeek API,原生支持多模态输入输出。开发者只需将模型名称更改为
deepseek-flash即可调用。旧版 V4 Flash 系列已下线,出于兼容性考虑,旧模型名将暂时路由至 V4.1 Flash。 - 合作伙伴接入:官方合作伙伴 WorkBuddy(含 CodeBuddy)和 OpenCode 已全量接入该模型,为代码生成与智能助手应用提供更强动力。
- 定价策略调整:得益于架构创新带来的成本下降,DeepSeek 下调了 V4.1 Flash 的 API 定价,并维持峰谷定价机制,闲时价格仅为高峰时段的50%,鼓励用户灵活调度资源。
- 开源计划:DeepSeek 承诺全力支持开源社区,提供模型权重与推理适配支持,并欢迎具备大规模部署能力的团队联系合作。
“我们的设计初衷是构建能力上限更高、推理速度更快、可扩展性更强的模型架构,让 AI 技术真正普惠于更多开发者与应用场景。”
随着 V4 Pro 的有序下线,DeepSeek V4.1 Flash 正成为新一代高效能、低成本 AI 推理的首选方案。