BrowserOS 发布 BrowserVLM:0.54B 超轻量 GUI 定位模型,重构浏览器 Agent 点击精度

ADK BrowserOS官方 / ADK编译 2026-08-17 5 分钟 91 次浏览
速览导读 / Summary

BrowserOS 正式发布 BrowserVLM,一款仅 0.54B 参数的 GUI 定位视觉语言模型。该模型在 ScreenSpot-V2 和 ScreenSpot-Pro 基准测试中分别取得 79.10 和 36.37 的分数,平均表现优于 UI-TARS-7B 且参数量仅为后者的十二分之一。通过创新的“分块 - 子块 - 位置”三级定位架构及递归深度改造,BrowserVLM 实现了像素级点击精度,同时大幅降低计算成本,使本地化运行浏览器 Agent 成为可能。

模型参数量 0.54B 仅解码器参数,含视觉塔约 400M
ScreenSpot-V2 分数 79.10 超越 UI-TARS-7B 的 7B 模型
ScreenSpot-Pro 分数 36.37 硬难度高分辨率测试表现优异
推理效率提升 12x 相比同类 7B 模型,参数量减少约 12 倍

Key Insights / 核心看点

  • 1 BrowserVLM 以仅 0.54B 参数实现了像素级 GUI 定位,在 ScreenSpot 基准测试中超越 7B 级模型 UI-TARS-7B。
  • 2 创新采用 'Patch-Subpatch-Location' 三级离散定位架构,彻底解决高分辨率下坐标回归精度衰减问题。
  • 3 引入 RRT(Relaxed Recursive Transformers)深度改造,在保持性能的同时进一步压缩模型体积。
  • 4 支持高频交互,单次截图推理成本大幅降低,使本地化运行浏览器 Agent 成为现实。
  • 5 基于 SigLIP2 视觉塔与 Qwen3 风格解码器融合,具备极强的屏幕结构理解与细节捕捉能力。

BrowserVLM:0.54B 超轻量 GUI 定位模型,重构浏览器 Agent 点击精度

在浏览器自动化与计算机操作领域,Agent 的核心瓶颈往往在于“点击决策”——即根据截图和指令,将意图精确映射到屏幕上的单个像素。传统的解决方案依赖庞大的视觉语言模型(VLM),如 Kimi-VL (16B) 或 Qwen2.5-VL (72B),这些模型虽然准确,但推理成本高昂(需 144GB VRAM),且单次截图消耗数千 Token,严重限制了交互频率。

针对这一痛点,BrowserOS 联合其研究实习生 Neel Gupta 推出了 BrowserVLM,一款专为浏览器 Agent 设计的 0.54B 参数 GUI 定位模型。其核心目标是在保持极低资源占用的同时,实现像素级的点击精度。

核心突破:小模型,大精度

BrowserVLM 在性能上实现了显著的“以小博大”。在业界公认的 ScreenSpot-V2ScreenSpot-Pro 基准测试中,BrowserVLM 分别取得了 79.1036.37 的分数,平均分为 57.73。这一成绩不仅超越了现有的 7B 级 GUI 专家模型(如 UI-TARS-7B),更在硬难度高分辨率测试中展现出卓越的能力。

关键优势:BrowserVLM 的参数量仅为 UI-TARS-7B 的约 1/12,却能在高保真度下提供像素级定位,彻底解决了大模型在长轨迹中上下文溢出和延迟过高的问题。

技术架构:从“回归坐标”到“离散定位”

BrowserVLM 摒弃了传统模型通过文本回归坐标(Regression)的方式,转而采用 离散化定位(Discrete Grounding) 策略,确保定位精度不随图像分辨率升高而衰减。

1. 三级精确定位机制

模型采用 Patch → Sub-patch → Location 的三级递归细化流程:

  • Patch (粗粒度):将屏幕划分为网格,模型首先定位到包含目标元素的粗略区域。
  • Sub-patch (中粒度):在选定的 Patch 内部进行二次细化,恢复因池化而丢失的细节。
  • Location (细粒度):在 Sub-patch 内确定最终点击坐标。

这种设计使得空间精度独立于图像分辨率(Resolution-independent),无论屏幕是 1080p 还是 4K,点击精度均能维持在像素级。

2. 递归深度改造 (RRT Retrofit)

为了在保持深度的同时进一步压缩模型体积,BrowserVLM 引入了基于 Relaxed Recursive Transformers (RRT) 的改造方案。该方案将深度转化为循环结构,在保持有效深度的同时,将存储的解码器大小缩减了约 9%,进一步降低了显存占用。

3. 架构融合

模型采用 SigLIP2 视觉塔与 Qwen3 风格 解码器的融合架构。图像被智能分块(Tiling)处理,预训练阶段最多 8 个 Crop,后训练阶段提升至 48 个 Crop,确保高细节屏幕信息的完整摄入。

实际应用价值

BrowserVLM 的发布标志着浏览器 Agent 从“云端依赖”向“本地高效”迈出了关键一步:

  • 降低门槛:0.54B 的体量使其能在普通消费级 GPU 甚至 CPU 上运行,无需昂贵的 A100 集群。
  • 提升效率:单次点击推理成本大幅降低,支持每分钟数十次的高频交互,不再受限于大模型的 Token 消耗。
  • 增强鲁棒性:在复杂 GUI 界面和高分辨率截图下,依然能保持稳定的点击准确率,解决了传统模型在细节元素上容易“失焦”的问题。

BrowserVLM 不仅是一个模型,更是构建下一代高效、低成本、本地化浏览器 Agent 的基础设施。随着相关代码与权重的开源,开发者有望借此大幅优化自身的自动化流程。


注:模型权重与代码库预计近期开源,具体细节请参阅官方技术论文。

Small enough to run beside your agent, not instead of it.

BrowserOS Co-Founder

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
产品动态 2026-09-06

Adobe Photoshop 与 Upscale.media 联手:AI 驱动图像超分辨率技术深度解析

Adobe Photoshop 与 AI 图像增强工具 Upscale.media 宣布深度整合,旨在为专业用户提供更高效的图像超分辨率解决方案。此次合作利用先进的 AI 算法,在不依赖复杂软件学习曲线的情况下,实现从低分辨率到高清图像的无损转换。文章详细阐述了该技术在保留细节、修复模糊以及支持多格式处理方面的核心优势,并展示了从上传到下载的完整操作流程,标志着图像增强领域向更智能化、便捷化方向迈出了重要一步。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Adobe Photoshop 2025 图像分辨率优化指南:超分辨率与智能放大技巧

Adobe Photoshop 2025 在图像分辨率处理上带来了显著优化,重点介绍了如何利用内置的“超分辨率”功能无损放大 JPEG 图像。本文详细解析了从基础图像尺寸调整到高级 Camera Raw 滤镜应用的完整流程,帮助设计师和摄影师在保持画质的前提下提升输出质量。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Upscale.media 发布智能图像增强方案:AI 驱动高清修复与细节重构

Upscale.media 推出全新图像增强指南,详解如何利用 AI 技术将低分辨率图片转化为高清视觉内容。文章解析了图像上采(Upscaling)的核心原理,涵盖分辨率、锐度、色彩准确性等关键质量指标,并展示了该工具在商业展示、印刷输出及个人创作中的实际应用价值,旨在帮助用户摆脱像素化困扰,实现无损画质提升。

Upscale.media官方 / ADK编译 4 分钟
agent · 免费
★ 5.0 · 120评测
B

BrowserOS

免费开源的 AI Agent 浏览器

BrowserOS 是免费开源的AI Agent 浏览器,BrowserOS 将强大的 AI 智能体直接集成到浏览器中,运行在本地,支持自动化任务(如填写表单、安排会议)和深度研究功能。BrowserOS 注重隐私,支持本地运行模型(如 Ollama),数据不会上传到云端。BrowserOS 提供语义搜索、本地 AI 聊天和生产力工具,兼容所有 Chrome 扩展,界面与Google  Chrome 类似,用户无需学习成本即可上手。

查看 BrowserOS 使用教程与功能