VLA 模型为何忽视语言指令?Label Studio 揭秘数据根源与低成本修复方案
在机器人领域,Vision-Language-Action (VLA) 模型被视为实现通用物理智能的关键。然而,Label Studio 团队近期发布的一项深度研究揭示了一个令人不安的现实:许多最先进的 VLA 模型在部署后,其语言模块实际上并未发挥任何作用。
核心问题:模态失衡与信息坍缩
研究团队通过审计当前机器人学习语料库发现,模态失衡 (Modality Imbalance) 是导致语言失效的根本原因。
- 视觉与动作流的丰富性:训练数据中的视觉流包含不同的光照、物体位置和遮挡;动作流则是独特的连续电机命令序列。
- 语言流的贫乏:相比之下,语言指令往往由模板生成,如
pick up the {object},缺乏结构多样性。
这种不平衡导致信息坍缩 (Information Collapse)。当指令可以从图像中直接推断时(例如:看到杯子在水槽旁,指令必然是“把杯子放进水槽”),模型为了优化,会丢弃语言输入,转而依赖视觉捷径。这被称为语言遗忘 (Language Forgetting)。
此外,监督别名 (Supervision Aliasing) 也是一个关键问题。现有数据集通常只标注粗粒度的目标(如“拿起杯子”),而忽略了执行细节(如“用哪只手”、“从哪个角度接近”)。这种模糊的标签导致模型无法在关键执行层面进行区分。
实测数据:灾难性的鲁棒性缺失
当模型离开训练分布进入真实世界时,问题暴露无遗:
- 指令扰动测试:在 LIBERO-PRO 基准测试中,即使将指令替换为同义句或无意义词汇,模型的成功率依然保持在 90% 以上,完全无视指令变化。
- 性能下降:控制性研究指出,对指令进行同义改写会导致性能下降 22% 至 52%。
- 记忆化策略:由于无法理解语言,模型退化为死记硬背视觉布局与动作序列的对应关系,一旦环境微调即失效。
解决方案:无需新数据的低成本修复
Label Studio 团队强调,修复此问题不需要收集任何新的轨迹数据,仅需对现有数据进行标注增强:
- 指令增强 (Instruction Augmentation):对同一轨迹重新标注为多种不同的、具有区分度的语言指令。LangGap 基准测试证实,此方法可将单任务成功率从 0% 提升至 90%。
- 反事实标注 (Counterfactual Relabeling):为轨迹添加其实际未执行但满足条件的指令,强迫模型关注指令与动作的细微差别。CAST 项目因此获得了 +27 个百分点 的性能提升。
- 细粒度标注 (Fine-grained Annotation):针对 FineVLA 提出的监督别名问题,标注具体的执行细节(主动臂、接近方向、接触区域)。
总结
VLA 模型的“语言失效”并非架构缺陷,而是数据构建方式导致的系统性偏差。通过引入多样化的语言指令和细粒度的执行描述,开发者可以以极低的成本显著增强机器人的指令遵循能力,使其从“视觉捷径”转向真正的“语义理解”。