Warp 发布 Factory Benchmarks:从“凭感觉”到“数据驱动”的 AI 工程新范式
Warp 于 2026 年 9 月 3 日推出了 Factory Benchmarks,这是首个完全基于用户自有代码任务生成的模型基准测试工具。与传统的公开基准(如 SWEBench 或 Terminal Bench)不同,Factory Benchmarks 直接运行于用户的实际开发上下文(Context)中,旨在解决开发者在模型选择与技能配置上的“试错成本”问题。
“我们的目标是向全球顶尖工程团队提供构建、测量和优化 AI 代理系统的工具,让工程从‘凭感觉’(on vibes)转向基于数据的精准优化。” —— Warp 官方团队
核心突破:真实场景下的自动化评估
Factory Benchmarks 的核心价值在于将评估从理论数据迁移到生产环境。它允许开发者定义一套基于团队过往运行记录或从头构建的代理任务集,并自动运行不同模型(如 GPT-5.6, GLM-5.3, Claude Opus)与代理(如 Warp, Claude Code, Codex)的矩阵测试。
关键特性
-
基于代码的定义(Code-First Definition) 用户通过
factory.yaml和benchmark definition .yaml文件定义基准测试。这不仅记录了工厂的完整状态,还支持 A/B 测试不同的配置组合,确保实验的可复现性。 -
内置的评分器(Scorers) 系统内置了基于“LLM-as-a-judge”的评分机制,用户可自定义评估维度,包括正确性(Correctness)、效率(Efficiency)、成本(Cost)、简洁度(Verbosity)等。评分器不仅用于评估,还用于驱动工厂的自我改进循环。
-
全链路可观测性 基础设施自动存储所有代理运行轨迹(Agent Traces)及其元数据,包括提示词(Prompt)、完整对话、Git 状态(运行前后的差异)、PR 及生成的所有 artifacts。这对于企业级安全边界内的数据隔离至关重要。
-
帕累托最优可视化 系统生成帕累托图(Pareto Graphs),直观展示不同配置在各维度上的权衡。例如,在简单 UI 任务中,GPT-5.6 Sol (high) 被证明在成本与质量之间取得了最佳平衡。
实际应用价值:成本优化与智能路由
Warp 团队利用 Factory Benchmarks 已成功调整内部工厂配置,在特定任务类型上实现了 63% 的成本降低,同时未影响输出质量。这一数据验证了该工具在工程落地中的巨大潜力。
智能模型路由(Custom Model Routers)
基于基准测试结果,开发者可以构建自定义模型路由规则。这些规则由分类器驱动,能够根据任务特征动态选择最优模型配置。
- 场景示例:针对服务器代码库中的简单前端变更任务,系统自动识别出 Grok-4.6 (med) 在基准测试中表现最优,并配置路由规则优先调用该模型。
- 效果:这种动态路由机制避免了“一刀切”使用大模型带来的资源浪费,显著提升了整体工程效率。
技术架构亮点
- 自动化任务发现:通过“工厂主管”(Foreman)功能,系统可扫描历史运行记录,自动筛选出适合复用的测试任务(如“找到 5 个代码量少于 50 行且涉及 UI 变更的任务”),大幅降低基准构建门槛。
- 灵活的代理切换:支持在同一基准测试中切换不同的代理工具(如 Warp vs. Claude Code vs. Codex),全面评估工具链性能。
- 自我改进闭环:基准测试结果可直接反馈至工厂配置,触发自动化的自我改进循环,持续提升代理系统的表现。
Factory Benchmarks 标志着 AI 工程进入了一个新的成熟阶段:不再依赖直觉,而是通过严谨的数据测量来驱动决策,为构建高效、低成本且高质量的 AI 代理系统奠定了坚实基础。