DeepSeek V4 小说写作评测:百万上下文与智能体能力实测

ADK FeelFish官方 / ADK编译 2026-08-11 5 分钟 52 次浏览
速览导读 / Summary

FeelFish 联合 DeepSeek 团队发布 V4 模型小说写作深度评测。文章通过《穿越大唐开饭馆》案例,展示了 DeepSeek-V4-Flash 在指令遵循、逻辑连贯性及工具调用上的显著进步。相比 V3.2,V4 在保持长篇剧情一致性、减少情感化结尾等方面表现优异,且成本降低近一半,为网文创作提供了高性价比的 AI 辅助方案。

Key Insights / 核心看点

  • 1 FeelFish 联合 DeepSeek 团队发布 V4 模型小说写作深度评测。文章通过《穿越大唐开饭馆》案例,展示了 DeepSeek-V4-Flash 在指令遵循、逻辑连贯性及工具调用上的显著进步。相比 V3.2,V4 在保持长篇剧情一致性、减少情感化结尾等方面表现优异,且成本降低近一半,为网文创作提供了高性价比的 AI 辅助方案。

DeepSeek V4 小说写作能力深度评测:从穿越大唐看 AI 进阶

2026 年 4 月,DeepSeek 正式发布了 V4 版本模型,涵盖 Flash 和 Pro 两个版本,均支持 1M 上下文窗口。此次评测由 AI 小说创作工具 FeelFish 主导,旨在通过实战案例验证 V4 在长篇小说创作中的核心能力。

评测背景:从 V3.2 到 V4 的跨越

DeepSeek-V4 系列在 Agent 能力、世界知识储备及推理性能上均实现了重大突破。特别是在 Agentic Coding 评测中,V4-Pro 已达到开源模型最佳水平,甚至在简单任务上与 V4-Flash 旗鼓相当。

本次评测聚焦于小说写作这一垂直场景。我们选取了热门题材“穿越文”,利用 FeelFish 的专业辅助模式,基于 DeepSeek-V4-Flash 开启思考模式,尝试创作小说《穿越大唐开饭馆》。

核心亮点:实战效果分析

1. 逻辑连贯性与剧情推进

在第一章的创作中,V4-Flash 展现了极强的指令遵循能力。文章从主角于航穿越到秦岭古庙,到误入长安城,再到西市开饭馆,情节转折自然流畅。

  • 细节呼应:关键道具“几包方便面”在开头作为穿越背景,结尾成为主角在长安城的第一笔收入,形成了完美的闭环。
  • 逻辑自洽:对于唐代饮食文化的描写(如铁锅未普及、调味简单)符合历史常识,展现了模型丰富的世界知识。

2. 告别“强行升华”的叙事缺陷

评测发现,相比 V3.2 版本,V4 在叙事风格上有了明显优化。

  • V3.2 问题:常在结尾处出现生硬的抒情或强行升华,破坏沉浸感。
  • V4 改进:结尾处主角看着铜钱露出灿烂笑容,并自信地表示“明天整点更厉害的”,这种通过行动表达自信的方式,比直接抒情更符合人物性格,逻辑更加通顺。

3. 工具调用与变量替换

测试中,我们将主角姓名从“于航”修改为“沈逸”,模型能够准确识别并更新全文相关引用,未出现幻觉或逻辑断裂。这表明 V4 在长文本上下文管理上的稳定性已大幅提升。

性能对比与价值总结

维度 DeepSeek V3.2 DeepSeek V4-Flash DeepSeek V4-Pro
上下文窗口 较低 1M Tokens 1M Tokens
推理能力 基础 超越所有开源模型 超越所有开源模型
世界知识 一般 大幅领先开源,接近 Gemini-Pro-3.1 接近 Gemini-Pro-3.1
Agent 能力 基础 简单任务与 Pro 相当 达到开源最佳水平
成本效益 较高 便宜近一半 较高

实测结论: 在价格比 V3.2 便宜近一半的情况下,DeepSeek-V4-Flash 在小说写作任务上的表现已完全不输旧版,且在逻辑严密性和上下文保持上实现了质的飞跃。对于需要长篇连载的网文作者而言,V4 提供了极佳的性价比。

未来展望

虽然第一章表现优异,但长篇创作对技能调用(如生成封面、查询历史资料)和剧情一致性(防止后期 OOC 或人设崩塌)提出了更高要求。FeelFish 将继续深入评测 V4 在百万上下文下的长篇小说创作能力,并探索如何利用多智能体架构进一步优化创作流程。

“DeepSeek-V4 已成为公司内部员工使用的 Agentic Coding 模型,据评测反馈使用体验优于 Sonnet 4.5。” —— DeepSeek 官方团队


后续我们将持续更新 DeepSeek V4 在技能调用、长篇剧情一致性保持等维度的深度评测。

同主题深度资讯

查看更多 →
产品动态 2026-09-04

CodeRabbit 评测 OpenAI GPT-6 Astra:跨文件代码审查能力跃升,隐私与成本深度解析

CodeRabbit 发布最新评测报告,深度分析 OpenAI GPT-6 Astra 在代码审查领域的表现。结果显示,Astra 在跨文件审查中比 GPT-5.6 Sol 多发现 20% 的潜在 Bug,比 Opus 5 多发现 33%。文章详细拆解了 Astra 的高昂 API 成本(输入$10/百万,输出$50/百万)与性能提升的性价比,并探讨了其在多步推理任务中的通用潜力。

CodeRabbit官方 / ADK编译 5 分钟
产品动态 2026-09-03

LocalBanana 实测:仅用胶片名无法区分 Portra 400 与 Pro 400H,行为描述才是关键

LocalBanana 团队在 Nano Banana Pro 模型上进行了严谨的 Portra 400 与 Fuji Pro 400H 胶片模拟测试。实验发现,仅输入胶片名称无法有效区分两种风格,尤其在逆光场景下效果几乎一致。通过详细描述色彩响应(如 Portra 的暖调与 Pro 400H 的冷调、低对比度),模型能更精准地还原胶片质感。文章强调了从“名词调用”转向“行为描述”的提示工程新范式。

LocalBanana官方 / ADK编译 5 分钟
产品动态 2026-09-03

GPT Image 在文字排版控制测试中胜出:LocalBanana 深度评测 12 组精准输出

LocalBanana 于 2026 年 9 月 3 日发布了一项针对 GPT Image、Nano Banana Pro 和 Midjourney V8.2 的严格文字渲染测试。通过 12 组受控输出(Controlled Outputs),测试涵盖了精确短语、层级结构、标点符号及排版约束。结果显示,GPT Image 在整体排版服从性上表现最佳,完美复刻了所有指定行断与布局;Nano Banana Pro 字符准确率高但偶有物理边界溢出;Midjourney V8.2 虽拼写无误,但在行结构控制上存在明显缺陷。该测试表明,生成式 AI 图像工具的核心竞争力已从单纯的“拼写”转向“排版服从性”。

LocalBanana官方 / ADK编译 5 分钟
产品动态 2026-08-21

OpenRouter 发布视觉图像基准测试:39 款模型能力全景评测

OpenRouter 正式推出“视觉图像基准测试”(Visual Image Benchmarks),旨在解决当前图像模型选型缺乏客观标准的问题。平台针对 39 款图像生成模型设计了七大类挑战性提示词(如不可能场景、计数、空间关系等),提供按价格与生成时间排序的网格化对比结果,帮助开发者快速筛选模型。同时,该评测体系将扩展至视频与音频模态,构建多模态能力评估生态。

OpenRouter官方 / ADK编译 4 分钟
writing · 免费+付费
★ 5.0 · 120评测
F

FeelFish

专为小说创作者打造的 AI 写作 PC 客户端软件

FeelFish 是专为小说创作者设计的AI 写作工具,通过智能辅助提升创作效率和质量。支持剧本和非虚构类书籍创作,擅长长篇内容的创作。面向专业作家设计,基于 FeelFish 智能体提供优秀的人机交互页面,让 AI 和作家可以深度地协作共创优质小说等专业内容。具备强大的角色和设定规划功能,可让用户详细输入角色性格、外貌、背景以及世界观规则,AI 会严格遵循这些设定进行创作,避免人设崩塌或逻辑矛盾。FeelFish 的上下文管理功能可自动总结前文内容,确保新生成的章节自然衔接,保持风格和剧情连贯性。支持多种主流大模型,如 DeepSeek、ChatGPT、Gemini 等,用户可根据需求选择合适的模型,通过自定义提示词精准控制创作方向。

查看 FeelFish 使用教程与功能