BrowserVLM:0.54B 超轻量 GUI 定位模型,重构浏览器 Agent 点击精度
在浏览器自动化与计算机操作领域,Agent 的核心瓶颈往往在于“点击决策”——即根据截图和指令,将意图精确映射到屏幕上的单个像素。传统的解决方案依赖庞大的视觉语言模型(VLM),如 Kimi-VL (16B) 或 Qwen2.5-VL (72B),这些模型虽然准确,但推理成本高昂(需 144GB VRAM),且单次截图消耗数千 Token,严重限制了交互频率。
针对这一痛点,BrowserOS 联合其研究实习生 Neel Gupta 推出了 BrowserVLM,一款专为浏览器 Agent 设计的 0.54B 参数 GUI 定位模型。其核心目标是在保持极低资源占用的同时,实现像素级的点击精度。
核心突破:小模型,大精度
BrowserVLM 在性能上实现了显著的“以小博大”。在业界公认的 ScreenSpot-V2 和 ScreenSpot-Pro 基准测试中,BrowserVLM 分别取得了 79.10 和 36.37 的分数,平均分为 57.73。这一成绩不仅超越了现有的 7B 级 GUI 专家模型(如 UI-TARS-7B),更在硬难度高分辨率测试中展现出卓越的能力。
关键优势:BrowserVLM 的参数量仅为 UI-TARS-7B 的约 1/12,却能在高保真度下提供像素级定位,彻底解决了大模型在长轨迹中上下文溢出和延迟过高的问题。
技术架构:从“回归坐标”到“离散定位”
BrowserVLM 摒弃了传统模型通过文本回归坐标(Regression)的方式,转而采用 离散化定位(Discrete Grounding) 策略,确保定位精度不随图像分辨率升高而衰减。
1. 三级精确定位机制
模型采用 Patch → Sub-patch → Location 的三级递归细化流程:
- Patch (粗粒度):将屏幕划分为网格,模型首先定位到包含目标元素的粗略区域。
- Sub-patch (中粒度):在选定的 Patch 内部进行二次细化,恢复因池化而丢失的细节。
- Location (细粒度):在 Sub-patch 内确定最终点击坐标。
这种设计使得空间精度独立于图像分辨率(Resolution-independent),无论屏幕是 1080p 还是 4K,点击精度均能维持在像素级。
2. 递归深度改造 (RRT Retrofit)
为了在保持深度的同时进一步压缩模型体积,BrowserVLM 引入了基于 Relaxed Recursive Transformers (RRT) 的改造方案。该方案将深度转化为循环结构,在保持有效深度的同时,将存储的解码器大小缩减了约 9%,进一步降低了显存占用。
3. 架构融合
模型采用 SigLIP2 视觉塔与 Qwen3 风格 解码器的融合架构。图像被智能分块(Tiling)处理,预训练阶段最多 8 个 Crop,后训练阶段提升至 48 个 Crop,确保高细节屏幕信息的完整摄入。
实际应用价值
BrowserVLM 的发布标志着浏览器 Agent 从“云端依赖”向“本地高效”迈出了关键一步:
- 降低门槛:0.54B 的体量使其能在普通消费级 GPU 甚至 CPU 上运行,无需昂贵的 A100 集群。
- 提升效率:单次点击推理成本大幅降低,支持每分钟数十次的高频交互,不再受限于大模型的 Token 消耗。
- 增强鲁棒性:在复杂 GUI 界面和高分辨率截图下,依然能保持稳定的点击准确率,解决了传统模型在细节元素上容易“失焦”的问题。
BrowserVLM 不仅是一个模型,更是构建下一代高效、低成本、本地化浏览器 Agent 的基础设施。随着相关代码与权重的开源,开发者有望借此大幅优化自身的自动化流程。
注:模型权重与代码库预计近期开源,具体细节请参阅官方技术论文。