百万小时人类视频:为何“无用”直到被标注?
在视觉 - 语言 - 动作(VLA)研究的宏大叙事中,一个令人振奋的数字往往也是最具误导性的:人类视频库。HumanNet 汇编了约 100 万小时的人眼视角(egocentric)视频,Being-H0.5 则使用了 3.5 万小时的同类数据。面对这些海量、免费且由人类日常操作产生的素材,业界曾一度认为数据瓶颈已近终结。
然而,Label Studio 团队指出,这些视频之所以被称为“无用”,是因为它们是无动作(action-free)的。它们记录了“发生了什么”,却未记录“该怎么做”。将像素中的手部动作转化为机器人策略可学习的信号,是机器人领域最大的标注挑战之一。
为什么人类视频不能直接训练机器人?
一台远程操作(teleoperated)的机器人数据包含一个特权要素:同步的动作流。每一帧都精确对应产生该帧的电机指令,位于机器人自身的动作空间中。这是行为克隆(Behavioral Cloning)学习的基础。
相比之下,人类视频缺乏这一切:
- 没有关节角度或夹爪指令;
- 没有动作标签;
- 手部并非机器人的末端执行器。
这就产生了对应问题(Correspondence Problem):如何将五指的灵活手部运动映射到平行夹爪的机械结构上?视频展示了“做什么”,却缺失了“怎么做”的记录。因此,整个子文献领域致力于从被动视频中提取动作,这本质上是一种自动化标注尝试。
缺失的任务对齐标注是最大瓶颈
当团队尝试直接使用人类视频时,遇到的阻碍并非视频数量,而是缺乏任务对齐的标注(task-aligned annotations)。
- 片段分割缺失:连续视频必须被切割为有意义的单元(如“打开抽屉”、“取杯子”),否则无法用于下游训练。
- 姿态与轨迹缺失:需要恢复手部姿态、接触事件及物体轨迹,将像素转化为几何信息。
- 动作原语缺失:缺乏与指令对齐的行为原语(如 reach, grasp, transport),导致策略模型缺乏行为词汇表。
- 意图语言缺失:缺乏细粒度的执行级语言,将指令精确锚定到特定片段。
EgoVLA 等项目证明了人类视频作为训练源的潜力,但这完全依赖于一个缺失的标注管道。正如 Label Studio 所言:视频是必要的,但远非充分条件。
标注栈:从原材料到资产
若要评估人类视频的数据价值,必须看清所需的完整标注栈,每一层都增加了底层无法提供的价值:
- 片段与任务分割:将长视频切割为语义单元。
- 手部与物体姿态:将像素转化为几何,解决对应问题。
- 动作与原语标签:定义与指令对齐的行为原语。
- 意图对齐语言:提供细粒度、可执行的指令描述。
OpenEgo 是一个优秀的架构示例,它定义了结构化标注而非留作无差别的素材。其核心教训是:标注层才是资产,原始小时数只是商品。
自动化的局限:为何仍需人工标注
有人质疑:潜行动作模型和逆动力学模型不能自动完成标注吗?
答案是部分可以,但存在严重局限。通用 2D 预训练视觉语言模型在细粒度空间判断(如接触点、接近方向、手物关系)上最为薄弱。此外,判断平行夹爪“应该”做什么,是一个需要深度语义理解的判断过程,自动化模型极易产生看似合理实则错误的“静默失败”。因此,自动化标注只能作为辅助,高质量的人工标注(Human-in-the-loop)仍是构建可靠机器人数据集的关键。
“人类视频不是数据集,而是原材料。将原材料转化为训练数据所需的劳动,才是将数据转化为资产的关键。” —— Label Studio 团队