LIBERO 基准测试的虚假繁荣:VLA 领域的“记忆”陷阱
在计算机视觉与机器人学(VLA)的研究热潮中,LIBERO 已成为衡量视觉 - 语言 - 动作模型能力的“通用环境”。然而,Label Studio 团队在最新的技术分析中指出,这一基准测试正被广泛滥用,导致学术界和工业界普遍高估了模型的真实能力。
核心问题:95% 的成功率是“作弊”吗?
许多研究团队在微调 VLA 模型后,在 LIBERO 上报告高达 95% 的成功率。然而,当这些模型被部署到真实机器人或稍有变化的环境中时,表现往往一落千丈。
Label Studio 团队分析了 arXiv 上超过 1,228 篇 VLA 论文,发现这一现象并非偶然,而是系统性问题:
- LIBERO-Plus 的扰动测试:通过微小的光照、角度或物体位置变化,LIBERO-Plus 将成功率从约 95% 骤降至 30% 以下。这表明模型学习的是“特定布局下的动作序列”,而非通用的任务理解。
- LIBERO-PRO 的极端失效:在更剧烈的扰动下,原本 90% 以上的成功率直接崩塌至 0%。研究发现,模型完全忽略了语言指令,仅执行记忆中的动作序列,表现出严重的“语言盲视”。
机制揭秘:奖励机制诱导了记忆
这种脆弱性的根源在于训练与评估的闭环设计:
- 稀疏自动编码器分析:研究发现,模型在小型数据集上微调后,其内部特征主要对应于“记忆的训练序列”,而非可复用的通用表示(如“拿起杯子”的概念)。
- 缺乏泛化激励:仅奖励成功的训练方式让模型没有理由去泛化;仅包含成功样本的数据让模型没有理由去恢复失败;语言贫乏的数据让模型没有理由去倾听指令。
评估指标的通胀与安全风险
除了基准测试的缺陷,评估指标本身也存在严重问题:
- 二元成功率的误导:MetaFine 的研究指出,将复杂任务简化为“通过/失败”的二元指标,可能将报告的绩效虚高 70%。一个成功抓取但掉落边缘的物体,与从未移动物体的得分完全相同。
- 样本量不足:大多数评估仅基于 25 次或少于 25 次的运行,且未提供置信区间。在这种样本量下,72% 与 80% 的差异属于统计噪声,但论文却常以此进行排名。
- 数据投毒风险:未经过严格筛选的基准数据存在安全隐患。已有研究证明,仅污染 0.31% 的训练样本即可实现 98-99% 的后门攻击成功率。如果评估集无法检测这种“作弊”,更无法检测被静默破坏的模型。
走向诚实评估:构建真实的数据标准
Label Studio 团队并未止步于批评,而是提出了构建“诚实评估数据”的四个关键属性:
- 刻意引入扰动:测试集必须包含训练时从未见过的条件,如新光照、新视角、新物体排列等。只有测试条件与训练条件不重叠,才能衡量真正的泛化能力。
- 分级结果而非二元判定:摒弃简单的 Pass/Fail,采用细粒度评估(如:是否到达物体、是否完成抓取、是否完成运输)。Eval-Actions 等项目已在此方向上取得了进展。
- 充足的样本量与统计显著性:评估需要足够大的样本量以支持置信区间的计算,确保排名具有统计学意义。
- 安全与可追溯性:建立严格的数据清洗流程,防止数据投毒,确保评估结果的可信度。
结语
VLA 领域的未来不在于堆砌更高的 LIBERO 分数,而在于构建能够反映真实世界复杂性的评估体系。Label Studio 的这篇分析为整个社区敲响了警钟:我们需要从“记忆测试”转向“能力验证”,从“二元指标”转向“分级评估”,以确保机器人 AI 真正具备在未知环境中可靠工作的能力。
本文编译自 Label Studio 官方博客关于 VLA 评估问题的系列文章第四篇。