OpenRouter 发布视觉 API 指南:详解多模态图像输入与模型选型策略
OpenRouter 于 2026 年 8 月 14 日发布了最新的技术教程,旨在帮助开发者深入理解如何通过 API 将图像输入给大语言模型(LLM)。随着多模态能力的普及,如何正确构建请求体(Request Body)成为了连接本地数据与云端 AI 能力的关键。
核心更新:视觉输入标准化
OpenRouter 的视觉功能基于标准的 Chat Completions API,无需改变现有的集成逻辑,仅需调整 model 字段即可切换至支持视觉的模型。
请求体结构变化
对于纯文本对话,content 是一个字符串。加入图像后,content 变为包含两个部分的数组:
{
"role": "user",
"content": [
{ "type": "text", "text": "What's in this image?" },
{ "type": "image_url", "image_url": { "url": "https://example.com/receipt.jpg" } }
]
}
关键点:
- 顺序重要:文本部分必须排在图像部分之前,以便解析器正确识别。
- 模型无关性:无论选择
anthropic/claude-opus-4.8还是google/gemini-3-flash-preview,请求格式完全一致,极大降低了测试不同模型的成本。
图像传输策略:URL vs Base64
OpenRouter 支持两种图像传输方式,开发者需根据场景灵活选择:
-
公网 URL (Public URL)
- 适用场景:图像已托管在 CDN、S3(带签名链接)或自有服务器上。
- 优势:请求体更小,由服务端自行获取字节,适合处理大文件。
- 限制:依赖外部链接的可用性,可能受访问控制或区域限制影响。
-
Base64 数据 URL
- 适用场景:本地文件、用户上传的敏感数据(如身份证)、无公网访问权限的文件。
- 优势:文件仅通过 API 调用传输,不依赖外部链接稳定性;支持 PNG, JPEG, WebP, GIF 等格式。
- 代价:请求体体积较大,上传耗时较长。
多模型视觉能力对比
OpenRouter 强调,不同视觉模型各有侧重:
- OCR 能力:部分模型在读取截图中的文字(如票据、表格)上表现更佳。
- UI 分析:某些模型更擅长理解界面布局和元素关系。
- 图表推理:特定模型在处理复杂数据图表的逻辑推理上更为严谨。
由于请求格式统一,开发者可以在不修改代码的情况下,通过切换 model 字段来 A/B 测试不同模型的表现。
代码示例
文章提供了 cURL、Python 和 TypeScript 的完整示例,展示了如何将本地文件转换为 Base64 并发送给 OpenRouter。
Python 示例 (本地文件转 Base64)
import base64, os, requests
def to_data_url(path: str, mime: str = "image/jpeg") -> str:
with open(path, "rb") as f:
b64 = base64.b64encode(f.read()).decode("utf-8")
return f"data:{mime};base64,{b64}"
# 替换为任意视觉模型
MODEL = "anthropic/claude-opus-4.8"
resp = requests.post(
"https://openrouter.ai/api/v1/chat/completions",
headers={"Authorization": f"Bearer {os.environ['OPENROUTER_API_KEY']}"},
json={
"model": MODEL,
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "What total is on this receipt?"},
{"type": "image_url", "image_url": {"url": to_data_url("receipt.jpg")}}
]
}]
}
)
print(resp.json()["choices"][0]["message"]["content"])
应用价值与未来展望
此次更新不仅提供了技术实现细节,还探讨了 Multimodal RAG(多模态检索增强生成)的构建思路,即如何检索包含图像信息的文档。这对于构建智能客服、文档分析工具及自动化质检系统具有极高的实用价值。
OpenRouter 愿景在于让开发者能够像调用文本模型一样简单且灵活地调用视觉模型,打破模态壁垒,释放多模态 AI 的无限可能。
注:本文基于 OpenRouter 官方 2026 年 8 月发布的视觉 API 指南编译。