Shortcut 深度评测:Opus 4.7 与 GPT-5.5 在 Excel 自动化中的终极对决
Shortcut 近期发布了其内部基准测试的最新成果,将两款前沿模型——Opus 4.7 与 GPT-5.5 进行了头对头(Head-to-Head)的实战对比。测试基于两个核心维度:v23(经典表格任务,耗时 1-4 小时)和 v25(极难任务,耗时数天),并覆盖了 Medium、High、Max 三种推理强度。
核心发现:速度与准确率的博弈
1. 准确率:GPT-5.5 登顶,Opus 4.7 稳健
在最具挑战性的 v25 任务中,GPT-5.5 以 73.9% 的准确率位居榜首,特别是在 Max 推理模式下,它比 Opus 4.7(72.4%)略胜一筹。这表明 GPT-5.5 在处理端到端复杂逻辑时具有更强的智能上限。
然而,Opus 4.7 并非没有进步。相比其前代 Opus 4.6,4.7 在 v25 的 Medium 难度下准确率从 63.0% 提升至 65.3%,显示出在长周期、高难度任务中的推理稳定性有所增强。
2. 速度:GPT-5.5 极速,Opus 4.6 Fast Mode 逆袭
在速度维度,GPT-5.5 表现惊人,v25 任务在 Max 模式下仅需 12.1 分钟,比 Opus 4.7 Max(23.3 分钟)快了一半。
值得注意的是,Shortcut 的 Opus 4.6 提供了独特的 Fast Mode(标准模式下的 2.5 倍加速)。开启此模式后,Opus 4.6 的完成时间缩短至约 8.5 分钟,在速度上已能与 GPT-5.5 并驾齐驱,且保持了相同的准确率。
3. 文档美学:Opus 的护城河
这是两者最本质的区别。在文档排版、表头格式、数字对齐等“文档美学”方面,Opus 4.6 依然是 Best-in-class(行业最佳)。其输出结果可直接交付给产品经理(MD),无需二次修改。
相比之下,GPT-5.5 虽然格式整洁,但被评价为“紧凑且机械(terser and mechanical)”,缺乏 Opus 那种经过深思熟虑的文档质感。
选型建议:根据任务场景决策
Shortcut 团队基于评测结果给出了明确的差异化建议:
- GPT-5.5:适合“一键式”(fire and forget)的极难任务,特别是那些已有明确格式规范、不需要人工干预的自动化流程。它是最快的“火力支援”。
- Opus 4.6:依然是 Shortcut 的默认首选。适合日常办公、需要高质量文档输出、以及需要清晰分步推理(Step-by-step reasoning)的场景。它是最贴心的“合作伙伴”。
- Opus 4.7:值得尝试,特别适合需要长时间运行的复杂任务,它在保持 4.6 风格的同时提升了长任务推理能力。
官方结语:"前沿模型在原始智力上已趋同,现在的区别在于‘看、感觉和品味’。就像开发者选择喜欢的 Agent 而非单纯比较智商一样,Opus 是更值得深思熟虑的伙伴。"
总结
此次评测揭示了 AI 工具发展的新阶段:Raw Intelligence(原始智力)已不再是唯一指标。在 Excel 自动化领域,Opus 4.6 凭借卓越的文档美学和推理清晰度继续占据生态核心,而 GPT-5.5 则以极致的速度和最高准确率成为处理极端复杂任务的利器。用户可根据任务对“速度”、“精度”和“文档质感”的权重,灵活切换模型。
关键指标 (Metrics)
| 指标 | 数值/描述 |
|---|---|
| GPT-5.5 v25 准确率 (Max) | 73.9% |
| Opus 4.7 v25 准确率 (Max) | 72.4% |
| GPT-5.5 v25 最快耗时 | 12.1 分钟 |
| Opus 4.6 Fast Mode 耗时 | ~8.5 分钟 (Max 难度) |
| Opus 4.6 排版评分 | Best-in-class (行业最佳) |
| v25 任务难度跨度 | 4.1 倍 (日常 vs 极难) |