DeepSeek V4.1 Flash:专为 Agent 设计的架构革命
DeepSeek 于 2026 年 9 月正式推出 V4.1 Flash,这并非一次常规的版本刷新,而是一次针对 Agent 工作负载 的深度架构重构。该模型旨在解决长提示、重复工具调用、大型代码库以及图文混合场景下的推理成本与效率问题,成为 V4 Pro 的临时过渡方案。
核心架构突破:Causal Encoder-Decoder (CED)
V4.1 Flash 最大的技术亮点在于其 Causal Encoder-Decoder (CED) 架构,彻底改变了传统 Decoder-only 模型在处理长上下文时的内存消耗模式。
- 分层设计:模型采用 40 层 Transformer 结构,分为 20 层因果编码器(Encoder)和 20 层解码器(Decoder)。
- KV Cache 压缩:Decoder 的全局 KV Cache 不再独立计算,而是从 Encoder 的最终隐藏状态投影而来。这种不对称设计使得在 Prefill(输入处理) 阶段仅需激活 80 亿 参数,而在 Decode(生成) 阶段激活 160 亿 参数。
- 压缩稀疏注意力 (CSA 2.0):引入静态模式(Full/Reindex/Reuse),通过层级稀疏索引器在解码器中共享 KV 数据和稀疏注意力索引,将全局 KV Cache 占用降至 890 字节/Token(约为 V4 Flash 的 1/4,V1 的 1/437)。
原生多模态与超长上下文
针对 Agent 需要处理复杂文档和图表的需求,V4.1 Flash 实现了原生多模态支持:
- 视觉编码器:从 scratch 训练的视觉编码器结合 2D-RoPE 和 3x3 像素重采样,将图像直接转换为语言模型的嵌入向量,无需转接外部模型。
- 1M Token 上下文窗口:提供巨大的上下文容量,支持大型代码库和长轨迹追踪,配合 SWA Bounded Replay 机制,将持久化缓存存储需求降低至 V4 Flash 的 1/8。
API 定价与应用价值
DeepSeek 推出了灵活的 API 定价策略,明确区分 缓存命中 (Cache Hit) 与 缓存未命中 (Cache Miss),并区分高峰与低谷时段:
| Token 类别 | 低谷价 (每 1M) | 高峰价 (每 1M) |
|---|---|---|
| 输入 (命中) | $0.003 | $0.006 |
| 输入 (未命中) | $0.15 | $0.30 |
| 输出 | $0.60 | $1.20 |
- 推理控制:支持连续的
reasoning_effort(1-100),允许开发者动态调整思考深度。 - 兼容性:提供 OpenAI 和 Anthropic 兼容的 Base URL,支持 JSON 输出、工具调用及 Responses API。
总结
DeepSeek V4.1 Flash 通过 CED 架构和先进的压缩技术,成功将长上下文推理的成本大幅降低,使其成为构建长期运行 Agent 的理想选择。对于需要处理大量文档、代码库及视觉信息的 AI 应用而言,这一更新提供了前所未有的性价比与性能平衡。
"DeepSeek V4.1 Flash is positioned as the temporary destination for V4 Pro traffic while it prepares a future V4.1 Pro." —— DeepSeek 官方团队