Claude Fable 5.1 正式发布:基准测试提升与 Agent 成本大幅降低
Anthropic 于 2026 年 9 月 1 日正式推出了 Claude Fable 5.1 和 Claude Mythos 5.1。这两款模型共享同一底层架构,但在安全策略和应用场景上有所区分:Fable 5.1 面向通用生产环境,已全面开放;Mythos 5.1 则仅限经过批准的网络安全和生命科学领域的可信访问。
此次发布不仅带来了模型能力的实质性飞跃,更通过重构计费模型,显著降低了长期运行 Agent 的经济成本,为开发者和企业级应用提供了极具吸引力的升级方案。
核心突破与功能特性
1. 全面的基准测试提升
Fable 5.1 在 Anthropic 发布的七大关键领域均取得了优于 Fable 5 的成绩,特别是在需要深度推理和工具调用的场景中表现突出。
- 终端编程与科学代理:在 Terminal-Bench-Science 0.1 中,Fable 5.1 得分达 52.6%,相比 Fable 5 的 24.7% 实现了翻倍增长;在 CursorBench 3.2.0 中,得分提升至 73.4%。
- 复杂任务解决能力:模型更倾向于解决根本问题而非走捷径,在罕见崩溃调试、多小时代码实现及长周期实验循环中表现优异。
- 跨学科推理:在 OSWorld 2.0 部分任务中得分 77.9%,在 Humanity's Last Exam 无工具模式下达到 60.9%。
2. 革命性的成本优化策略
这是本次发布最具商业价值的部分。Anthropic 大幅调整了缓存(Cache)的计费标准,直接针对长程 Agent 的痛点进行优化。
- 缓存价格暴跌:缓存命中(Cache Hits)价格从 $1/百万 token 降至 $0.25/百万 token(降幅达 75%)。
- 成本节省估算:对于典型的 Agent 工作负载,Anthropic 预计节省约 25% 的成本;对于高度依赖缓存的复杂代理任务,节省幅度最高可达 45%。
3. 灵活的 Effort 级别策略
Fable 5.1 支持 Low、Medium 和 High 三种 Effort 级别。用户无需总是选择最高配置,在中等或低 Effort 下即可在部分工作负载上达到与 Fable 5 相当的成本效益比,帮助团队根据任务复杂度动态调整资源。
对开发者与用户的实际价值
- 降低长期运维成本:对于需要持续读取仓库、重放工具结果和保持长上下文记忆的 Coding Agents,缓存价格的降低将直接转化为可观的 ROI。
- 提升复杂任务成功率:更高的基准分意味着在调试、科研和复杂工作流中,模型更有可能一次性正确完成任务,减少人工干预。
- 明确的安全边界:Mythos 5.1 的推出为敏感行业(如医疗、安全)提供了符合合规要求的高性能模型选择,无需担心通用模型的数据泄露风险。
关键指标 (Metrics)
| 指标 | 数值/描述 |
|---|---|
| 缓存命中价格 | $0.25 / 百万 tokens (较前代降低 75%) |
| 终端编程基准 (Terminal-Bench) | 55.8% (Fable 5.1) vs 42.0% (Fable 5) |
| 科学代理基准 (Terminal-Bench-Science) | 52.6% (Fable 5.1) vs 24.7% (Fable 5) |
| 预计成本节省 | 25% - 45% (针对高频缓存工作负载) |
| 发布状态 | Fable 5.1: 全面开放 (GA); Mythos 5.1: 仅限可信访问 |
官方引言
"This combination—stronger long-horizon work plus cheaper repeated context—matters for coding agents that continuously reread repositories, tool results, plans, tests, and prior steps."
—— Anthropic 官方团队,关于 Fable 5.1 架构与经济模型优化的说明
注:基准测试数据基于 Anthropic 提供的特定条件,非绝对通用排名。实际效果可能因任务版本、Harness 配置及环境差异而有所不同。