OpenRouter 发布 Ori Eval:让 AI 模型选择从“拍脑袋”转向数据驱动
随着 AI 功能在应用中的普及,开发者面临着前所未有的挑战:如何在超过 500 个可用模型中做出最佳选择?传统的做法往往依赖社交媒体推荐、基准测试排行榜或主观直觉,但这些方法存在明显局限——基准测试仅针对固定任务集,而推荐则反映了他人场景下的表现,无法准确预测模型在您特定的应用、数据、提示词和基础设施上的行为。
OpenRouter 深知这一痛点。他们推出了 Ori Eval,旨在解决“没有绝对最好的模型,只有最适合您构建之物的模型”这一核心命题。
核心突破:无需评估经验,自动构建评估体系
Ori Eval 最大的创新在于极大地降低了 AI 模型评估的门槛。对于从未写过评估脚本(eval)的开发者,它提供了一套零门槛的解决方案。
1. 智能代码扫描与需求访谈
Ori Eval 会主动扫描您的代码库,识别所有调用模型的节点。随后,它会像一位经验丰富的工程伙伴一样,与您进行“访谈”,询问哪些指标对您最重要:是成本($/PR)、延迟、速度、工具调用准确率,还是开放性问题回答的质量?
2. 自动化评估脚本生成
基于您的回答,Ori Eval 会自动编写 review.eval.ts 文件。这是一个标准的测试文件,您可以直接将其集成到 CI/CD 流水线中(如 GitHub Actions)。它不仅定义了测试用例,还内置了 LLM 裁判机制,用于自动评分开放性问题。
3. 并行测试与精准推荐
系统会在后台并行运行候选模型(默认选择最新的 5 个符合您需求的模型),并输出详细的对比表格,包含关键指标:
| 模型 | 错误捕获率 (catch) | P50 延迟 | 成本/千次请求 | 结果 |
|---|---|---|---|---|
| anthropic/claude-opus-5 | 94% | 38s | $0.041 | pass |
| openai/gpt-5.6-sol | 92% | 44s | $0.038 | pass |
| moonshotai/kimi-k3 | 90% | 31s | $0.019 | pass |
| z-ai/glm-5.2 | 86% | 26s | $0.008 | pass |
| google/gemini-3-pro | 84% | 52s | $0.062 | fail (cost) |
系统不仅给出推荐,还会附带理由,例如:“在您的成本约束下,该模型提供了最高的错误捕获率,且若错误审查量增长,该模型仍具性价比”。
实际应用价值:构建可维护的 AI 基础设施
Ori Eval 不仅仅是一次性的选型工具,更是一套持续优化的工程实践。
阻断回归,确保稳定性
评估文件本质上是代码。开发者可以将其纳入 CI 流程,一旦评估失败,构建即被阻止。这意味着任何导致模型表现下降的变更(回归)都无法进入生产环境。
动态模型迭代
由于评估脚本是纯代码,开发者可以轻松调度定期运行(如每月一次)。当新的模型发布并优于现有模型时,系统会自动生成 Pull Request,开发者只需合并即可体验性能提升,无需重新思考评估逻辑。
解决具体 Bug 的测试用例
对于已知 Bug(例如客服代理在未检查订单的情况下直接退款),开发者可以用自然语言描述,Ori Eval 会生成断言代码(如 lookup_order.toBeCalled()),确保该逻辑始终被测试覆盖。
如何开始使用
开发者只需向他们的编程助手发送一条指令即可启动:
curl -fsSL https://openrouter.ai/skills/spawn-ori-eval
随后跟随输出中的指引操作,Ori Eval 将引导您完成从需求确认到模型选型的整个过程。
“我们深知,在模型层出不穷的今天,没有‘最好’的模型,只有‘最适合’的模型。Ori Eval 就是为了帮您找到那个唯一的最佳解,并用数据向您证明。” —— OpenRouter 团队