Shortcut 发布 Pivot 0.5:27B 参数模型以 1/3 成本逼近 Sonnet 4.5 金融建模能力
在应用研究实验室必须有能力训练自身前沿模型以掌控命运的信念驱动下,Shortcut 今天发布了其首个模型——Pivot 0.5。这是一款专为金融和电子表格建模任务设计的 27B 参数模型,旨在重新定义垂直领域 AI 的效率边界。
核心突破:成本与性能的极致平衡
Pivot 0.5 的核心价值在于其在“精度 vs. 混合价格/任务”这一关键指标上的卓越表现。数据显示,Pivot 0.5 在保持与 Sonnet 4.5 相当准确性的前提下,将任务成本降低了约 3.5 倍。
- 基准测试表现:在 ShortcutBench v1 的 Spreadsheet Agent 基准测试中,Pivot 0.5 的得分从基线模型的 44% 跃升至 64.4%。
- 横向对比:该模型不仅击败了基座模型 Qwen3.5 在 8 项关键公开金融与电子表格基准中的 7 项,其表现也接近当前顶尖的开源模型 DeepSeek v4 Pro (67.2%)。
- 效率优势:与 DeepSeek v4 Pro 相比,Pivot 0.5 每任务成本仅为 $0.2(对比 $1.4),且处理速度提升 40%(15.8 分钟 vs 26.9 分钟/任务)。
技术架构:从数据到强化学习的完整闭环
Shortcut 强调其训练过程完全在内部完成,并为此构建了全新的电子表格环境。其训练策略分为两个关键阶段:
1. 基于真实用户数据的构建
训练数据完全来源于免费 tier 用户的真实交互,构建了涵盖 99% 任务的电子表格工作分类法(taxonomy)。
- 数据规模:处理约 30 万条智能体轨迹,提炼出 1981 个节点、1274 个叶节点的 10 级任务树。
- 意图分布:四大顶层意图覆盖了 99% 的任务,其中单纯的电子表格编辑(如写入值、公式、结构)占比高达 73%。
- 合成任务:通过这种分类,团队能够生成与真实用户分布一致的合成任务,确保模型训练 grounded in reality。
2. 双阶段训练策略
- 第一阶段:On-Policy Distillation (OPD) 利用 GLM-5.1 对模型自身输出的反馈进行训练,采用跨分词器损失(cross-tokenizer loss),将性能从 44% 提升至 53%。
- 第二阶段:RLVR (RL with Verifiable Rewards) 引入 GPT-5.5 作为可验证奖励的评判者。评判者首先根据任务生成检查清单(如目标单元格、预期公式),锁定评估范围,随后对候选工作簿进行批量评分。这一阶段将最终准确率推高至 64.4%。
基础设施创新:Mog 环境加速
为了加速强化学习训练,Shortcut 发布了其内部生产级的电子表格环境 Mog。该环境相比商业电子表格引擎,将 RL 环境执行速度提升了 20-30 倍,极大地缩短了模型迭代周期。
愿景与展望
"前沿质量的行业专用模型不应需要前沿规模的实验室。Pivot 0.5 是我们首个证据,表明小团队可以通过协同优化栈中的每一层,以低成本构建顶级表现模型。"
Shortcut 表示将定期发布 Pivot 的更新,并计划开源内部基准测试 ShortcutBench v1,该基准将作为 Shortcut.ai 生产版发布的门禁标准。
开发者现在可以在 Shortcut.ai 的研究预览版中免费尝试 Pivot 0.5,选择模型即可体验这一新的效率前沿。