DeepSeek V4 小说写作能力深度评测:从穿越大唐看 AI 进阶
2026 年 4 月,DeepSeek 正式发布了 V4 版本模型,涵盖 Flash 和 Pro 两个版本,均支持 1M 上下文窗口。此次评测由 AI 小说创作工具 FeelFish 主导,旨在通过实战案例验证 V4 在长篇小说创作中的核心能力。
评测背景:从 V3.2 到 V4 的跨越
DeepSeek-V4 系列在 Agent 能力、世界知识储备及推理性能上均实现了重大突破。特别是在 Agentic Coding 评测中,V4-Pro 已达到开源模型最佳水平,甚至在简单任务上与 V4-Flash 旗鼓相当。
本次评测聚焦于小说写作这一垂直场景。我们选取了热门题材“穿越文”,利用 FeelFish 的专业辅助模式,基于 DeepSeek-V4-Flash 开启思考模式,尝试创作小说《穿越大唐开饭馆》。
核心亮点:实战效果分析
1. 逻辑连贯性与剧情推进
在第一章的创作中,V4-Flash 展现了极强的指令遵循能力。文章从主角于航穿越到秦岭古庙,到误入长安城,再到西市开饭馆,情节转折自然流畅。
- 细节呼应:关键道具“几包方便面”在开头作为穿越背景,结尾成为主角在长安城的第一笔收入,形成了完美的闭环。
- 逻辑自洽:对于唐代饮食文化的描写(如铁锅未普及、调味简单)符合历史常识,展现了模型丰富的世界知识。
2. 告别“强行升华”的叙事缺陷
评测发现,相比 V3.2 版本,V4 在叙事风格上有了明显优化。
- V3.2 问题:常在结尾处出现生硬的抒情或强行升华,破坏沉浸感。
- V4 改进:结尾处主角看着铜钱露出灿烂笑容,并自信地表示“明天整点更厉害的”,这种通过行动表达自信的方式,比直接抒情更符合人物性格,逻辑更加通顺。
3. 工具调用与变量替换
测试中,我们将主角姓名从“于航”修改为“沈逸”,模型能够准确识别并更新全文相关引用,未出现幻觉或逻辑断裂。这表明 V4 在长文本上下文管理上的稳定性已大幅提升。
性能对比与价值总结
| 维度 | DeepSeek V3.2 | DeepSeek V4-Flash | DeepSeek V4-Pro |
|---|---|---|---|
| 上下文窗口 | 较低 | 1M Tokens | 1M Tokens |
| 推理能力 | 基础 | 超越所有开源模型 | 超越所有开源模型 |
| 世界知识 | 一般 | 大幅领先开源,接近 Gemini-Pro-3.1 | 接近 Gemini-Pro-3.1 |
| Agent 能力 | 基础 | 简单任务与 Pro 相当 | 达到开源最佳水平 |
| 成本效益 | 较高 | 便宜近一半 | 较高 |
实测结论: 在价格比 V3.2 便宜近一半的情况下,DeepSeek-V4-Flash 在小说写作任务上的表现已完全不输旧版,且在逻辑严密性和上下文保持上实现了质的飞跃。对于需要长篇连载的网文作者而言,V4 提供了极佳的性价比。
未来展望
虽然第一章表现优异,但长篇创作对技能调用(如生成封面、查询历史资料)和剧情一致性(防止后期 OOC 或人设崩塌)提出了更高要求。FeelFish 将继续深入评测 V4 在百万上下文下的长篇小说创作能力,并探索如何利用多智能体架构进一步优化创作流程。
“DeepSeek-V4 已成为公司内部员工使用的 Agentic Coding 模型,据评测反馈使用体验优于 Sonnet 4.5。” —— DeepSeek 官方团队
后续我们将持续更新 DeepSeek V4 在技能调用、长篇剧情一致性保持等维度的深度评测。