OpenRouter 发布 Ori Eval:让 AI 模型选择从“拍脑袋”转向数据驱动

ADK OpenRouter官方 / ADK编译 2026-08-03 5 分钟 128 次浏览
速览导读 / Summary

OpenRouter 推出 Ori Eval,一款专为开发者设计的自动化模型评估框架。针对当前市场上 500+ 模型选择困难且缺乏系统评估方法的痛点,Ori Eval 通过自动扫描代码库、生成评估脚本、并行测试候选模型并引入 LLM 裁判,帮助开发者以最低成本找到最适合其特定应用场景的最佳模型,并有效防止回归风险。

支持模型数量 500+ 覆盖主流及新兴实验室模型
评估脚本生成 全自动 基于自然语言需求自动生成 .eval.ts 文件
并行测试能力 多模型并发 同时运行多个候选模型以获取最优解
裁判机制 LLM-as-a-Judge 内置大模型裁判自动评分开放性问题

Key Insights / 核心看点

  • 1 零门槛评估:自动扫描代码库并生成评估脚本,无需开发者具备编写 eval 的经验。
  • 2 智能推荐引擎:基于成本、延迟、准确率等多维度指标,并行测试最新模型并给出带理由的推荐。
  • 3 CI/CD 集成:生成的评估文件可直接作为测试用例,自动阻断回归风险,支持定期自动更新模型。
  • 4 全链路覆盖:支持从工具调用准确性到开放性问题质量评分的全方位评估。

OpenRouter 发布 Ori Eval:让 AI 模型选择从“拍脑袋”转向数据驱动

随着 AI 功能在应用中的普及,开发者面临着前所未有的挑战:如何在超过 500 个可用模型中做出最佳选择?传统的做法往往依赖社交媒体推荐、基准测试排行榜或主观直觉,但这些方法存在明显局限——基准测试仅针对固定任务集,而推荐则反映了他人场景下的表现,无法准确预测模型在您特定的应用、数据、提示词和基础设施上的行为。

OpenRouter 深知这一痛点。他们推出了 Ori Eval,旨在解决“没有绝对最好的模型,只有最适合您构建之物的模型”这一核心命题。

核心突破:无需评估经验,自动构建评估体系

Ori Eval 最大的创新在于极大地降低了 AI 模型评估的门槛。对于从未写过评估脚本(eval)的开发者,它提供了一套零门槛的解决方案。

1. 智能代码扫描与需求访谈

Ori Eval 会主动扫描您的代码库,识别所有调用模型的节点。随后,它会像一位经验丰富的工程伙伴一样,与您进行“访谈”,询问哪些指标对您最重要:是成本($/PR)、延迟、速度、工具调用准确率,还是开放性问题回答的质量?

2. 自动化评估脚本生成

基于您的回答,Ori Eval 会自动编写 review.eval.ts 文件。这是一个标准的测试文件,您可以直接将其集成到 CI/CD 流水线中(如 GitHub Actions)。它不仅定义了测试用例,还内置了 LLM 裁判机制,用于自动评分开放性问题。

3. 并行测试与精准推荐

系统会在后台并行运行候选模型(默认选择最新的 5 个符合您需求的模型),并输出详细的对比表格,包含关键指标:

模型 错误捕获率 (catch) P50 延迟 成本/千次请求 结果
anthropic/claude-opus-5 94% 38s $0.041 pass
openai/gpt-5.6-sol 92% 44s $0.038 pass
moonshotai/kimi-k3 90% 31s $0.019 pass
z-ai/glm-5.2 86% 26s $0.008 pass
google/gemini-3-pro 84% 52s $0.062 fail (cost)

系统不仅给出推荐,还会附带理由,例如:“在您的成本约束下,该模型提供了最高的错误捕获率,且若错误审查量增长,该模型仍具性价比”。

实际应用价值:构建可维护的 AI 基础设施

Ori Eval 不仅仅是一次性的选型工具,更是一套持续优化的工程实践。

阻断回归,确保稳定性

评估文件本质上是代码。开发者可以将其纳入 CI 流程,一旦评估失败,构建即被阻止。这意味着任何导致模型表现下降的变更(回归)都无法进入生产环境。

动态模型迭代

由于评估脚本是纯代码,开发者可以轻松调度定期运行(如每月一次)。当新的模型发布并优于现有模型时,系统会自动生成 Pull Request,开发者只需合并即可体验性能提升,无需重新思考评估逻辑。

解决具体 Bug 的测试用例

对于已知 Bug(例如客服代理在未检查订单的情况下直接退款),开发者可以用自然语言描述,Ori Eval 会生成断言代码(如 lookup_order.toBeCalled()),确保该逻辑始终被测试覆盖。

如何开始使用

开发者只需向他们的编程助手发送一条指令即可启动:

curl -fsSL https://openrouter.ai/skills/spawn-ori-eval

随后跟随输出中的指引操作,Ori Eval 将引导您完成从需求确认到模型选型的整个过程。

“我们深知,在模型层出不穷的今天,没有‘最好’的模型,只有‘最适合’的模型。Ori Eval 就是为了帮您找到那个唯一的最佳解,并用数据向您证明。” —— OpenRouter 团队

There is no definitive best model - only the best model for what you're building.

OpenRouter 官方团队

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
产品动态 2026-09-06

Adobe Photoshop 与 Upscale.media 联手:AI 驱动图像超分辨率技术深度解析

Adobe Photoshop 与 AI 图像增强工具 Upscale.media 宣布深度整合,旨在为专业用户提供更高效的图像超分辨率解决方案。此次合作利用先进的 AI 算法,在不依赖复杂软件学习曲线的情况下,实现从低分辨率到高清图像的无损转换。文章详细阐述了该技术在保留细节、修复模糊以及支持多格式处理方面的核心优势,并展示了从上传到下载的完整操作流程,标志着图像增强领域向更智能化、便捷化方向迈出了重要一步。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Adobe Photoshop 2025 图像分辨率优化指南:超分辨率与智能放大技巧

Adobe Photoshop 2025 在图像分辨率处理上带来了显著优化,重点介绍了如何利用内置的“超分辨率”功能无损放大 JPEG 图像。本文详细解析了从基础图像尺寸调整到高级 Camera Raw 滤镜应用的完整流程,帮助设计师和摄影师在保持画质的前提下提升输出质量。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Upscale.media 发布智能图像增强方案:AI 驱动高清修复与细节重构

Upscale.media 推出全新图像增强指南,详解如何利用 AI 技术将低分辨率图片转化为高清视觉内容。文章解析了图像上采(Upscaling)的核心原理,涵盖分辨率、锐度、色彩准确性等关键质量指标,并展示了该工具在商业展示、印刷输出及个人创作中的实际应用价值,旨在帮助用户摆脱像素化困扰,实现无损画质提升。

Upscale.media官方 / ADK编译 4 分钟
code · 免费+付费
★ 5.0 · 120评测
O

OpenRouter

AI 模型 API 聚合平台,一个接口调用400多个模型

OpenRouter 是领先的 AI 模型API 聚合平台,一个接口调用 400 多个 AI 模型。OpenRouter通过智能路由技术优化模型选择和成本,支持自动故障转移和负载均衡,具备高可用性和性能。OpenRouter 提供隐私保护功能,支持零日志模式,支持用户根据数据政策选择合适的提供商。OpenRouter具备工具调用、实时网络搜索、图像和 PDF 处理等高级功能。OpenRouter统计功能能追踪模型使用情况,反映市场表现和用户偏好。OpenRouter 能简化 AI 的使用和管理,助力高效开发与部署。

查看 OpenRouter 使用教程与功能