OpenRouter 发布视觉图像基准测试:39 款模型能力全景评测
在 AI 模型选型日益复杂的今天,开发者往往面临一个难题:如何像评估文本大模型(LLM)那样,客观地衡量图像生成模型(Image Models)的真实能力?OpenRouter 官方今日宣布,为解决这一痛点,正式推出视觉图像基准测试(Visual Image Benchmarks)。
背景:打破图像模型评估的“黑盒”
过去,选择图像模型往往带有随意性。现有的评测方式存在明显局限:
- 样本 curated 化:官方展示的样本多为精心挑选的“视觉甜点”,难以反映模型在极端情况下的表现。
- LLM-as-a-judge 的局限:利用大模型作为评判者,无法捕捉人类肉眼能瞬间察觉的细微瑕疵。
- Arena 评分的偏差:现有的排名多基于用户偏好(Which output do people prefer?),而非模型的实际技术能力(What can a model actually do?)。
为此,OpenRouter 精心设计了 7 个挑战家族,旨在通过具体的视觉提示词(Prompts)来测试模型的边界。
核心突破:七大挑战家族
OpenRouter 为 39 款图像模型(截至 2026 年 8 月)设计了七大类测试场景,涵盖从逻辑推理到精细编辑的全方位能力:
- 不可能场景 (Improbable scenes):测试模型对物理常识的理解,例如“装满到杯口的酒杯”或“收起的雨伞”。
- 计数能力 (Counting):精确测试模型对细节的捕捉,如手指数量、特定数量的卡片或骰子。
- 文本生成 (Text):评估模型在海报上生成长串精确字符串,以及多语言同框的能力。
- 空间关系 (Spatial relations):考察对遮挡(Occlusion)和镜面反射的生成逻辑。
- 否定指令 (Negation):测试模型处理“无”的能力,如“无条纹的斑马”或“无广告的时报广场”。
- 编辑能力 (Editing):基于参考图像进行最小差异修改、物体移除或人物移除。
- 一致性 (Consistency):测试模型在生成新场景时,保持主体或产品姿态稳定的能力。
实用价值:透明化与可排序的对比
本次发布最大的亮点在于其结果可视化与排序机制。OpenRouter 将所有模型的测试结果以网格形式展示,并支持按价格(Price)和生成时间(Generation Time)进行排序。
这意味着开发者不再需要盲目尝试,而是可以直接看到:
- 在“计数”任务中,哪款模型最准确?
- 在“编辑”任务中,哪款模型能以最低成本完成?
未来展望:多模态评测体系
OpenRouter 表示,图像只是第一步。鉴于视频和音频模型评估同样缺乏客观标准,平台计划将这一基准测试工具扩展至更多模态(Modalities)。未来,开发者可以通过 OpenRouter API 或 Chat 接口,利用这些基准测试中的提示词,亲自验证模型在实际内容生成中的表现。
“我们希望通过这些基准测试,让图像模型的选型从‘凭感觉’转变为‘看数据’,为开发者提供清晰的能力雷达图。”
开发者若拥有能挑战下一代模型的提示词,欢迎在 Discord 的 #feedback 频道中分享。
关键指标 (Metrics)
| 指标 | 详情 |
|---|---|
| 评测模型数量 | 39 款图像模型 |
| 测试场景分类 | 7 大类(不可能场景、计数、文本、空间关系、否定、编辑、一致性) |
| 对比维度 | 价格、生成时间 |
| 扩展计划 | 视频、音频模态评测 |
核心亮点 (Key Highlights)
- 首个全模态图像基准:摒弃主观审美,通过 7 大类逻辑与物理挑战,客观量化模型能力。
- 开发者友好型排序:结果支持按价格和生成速度排序,直接辅助成本与效率决策。
- 多模态扩展路线图:评测体系将从图像延伸至视频与音频,构建统一的 AI 能力评估标准。
- API 与 Chat 双通道验证:支持通过官方接口直接复用基准测试 Prompt 进行自定义验证。