DeepSeek V4.1 Flash 发布:552B 参数 MoE 架构实现成本与智能的双重突破
DeepSeek 正式发布 V4.1 Flash 模型,采用创新的 Causal-Encoder-Decoder 非对称结构,以仅 8B 的输入激活实现 552B 参数 MoE 的高效推理。该模型在大幅降低 KV Cache 存储需求(HBM 减少至 1/4)的同时,在基准测试中超越 V4 Pro。官方宣布 API 支持多模态,并计划逐步下线旧版 V4 Pro,同时开源模型以推动生态发展。
深度求索,强劲的 AI 模型
深度求索打造的开源大模型,以强推理能力与高性价比著称。
在 platform.deepseek.com 创建。
使用 R1 模型处理复杂推理任务。
| 对比评测维度 | DeepSeek 表现 | 主要竞品分析 |
|---|---|---|
| 推理能力 | DeepSeek-R1 强推理 | @通用推理: 通用推理 |
| API 价格 | 极具性价比 | @价格较高: 价格较高 |
DeepSeek 正式发布 V4.1 Flash 模型,采用创新的 Causal-Encoder-Decoder 非对称结构,以仅 8B 的输入激活实现 552B 参数 MoE 的高效推理。该模型在大幅降低 KV Cache 存储需求(HBM 减少至 1/4)的同时,在基准测试中超越 V4 Pro。官方宣布 API 支持多模态,并计划逐步下线旧版 V4 Pro,同时开源模型以推动生态发展。
两个月前,我们发布了实验性的 DeepSeek-V3.2-Exp,并收到了众多热心用户反馈的对比测试结果。目前未发现 V3.2-Exp 在任何特定场景中显著差于 V3.1-Terminus,这验证了 DSA 稀疏注意力机制的有效性。也感谢广大用户一直以来的积极反馈与支持,为我们的持续创新注入了更多信心与动力。
今天,我们正式发布 DeepSeek-V3.2-Exp 模型,这是一个实验性(Experimental)的版本。作为迈向新一代架构的中间步骤,V3.2-Exp 在 V3.1-Terminus 的基础上引入了 DeepSeek Sparse Attention(一种稀疏注意力机制),针对长文本的训练和推理效率进行了探索性的优化和验证。
DeepSeek-V3.1-Terminus版本聚焦语言一致性与Agent能力优化,有效改善中英文混杂及异常字符问题。Code Agent与Search Agent表现显著提升,多平台同步更新。开源版本已上线,API接口全面适配新模型。
今天,我们正式发布 DeepSeek-V3.1。本次升级包含以下主要变化:
核心模型开源,支持本地部署与商用。