论文
LARY 同时评测潜在动作的语义与控制能力
LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment
摘要
显式动作数据不足限制了视觉语言动作(VLA)模型的发展,人类动作视频则提供可规模化但缺乏标签的数据来源。利用大规模人类视频的关键难题,是将视觉信号转为不依赖特定本体的“潜在动作”表示;而这种表示能否从视觉观测中支持稳健控制,尚缺少严格评估。我们提出LARY基准,以统一框架评价潜在动作表示在高层语义动作(做什么)及低层机器人控制(如何做)上的表现。整理后的数据集包含覆盖151类动作的超过100万段视频、共1,000小时,以及来自不同具身形态和环境的62万对图像和59.5万条运动轨迹。实验发现两点:未经动作监督训练的通用视觉基座模型,持续优于专用具身潜在动作模型;潜空间视觉表示与物理动作空间的对齐,也优于像素空间表示。这表明通用视觉表示本身编码了与物理控制相关的动作知识,语义层抽象是比像素层重建更有效的视觉到动作路径。