论文
明确的物理可行性可以有利于 VLA 学习吗?实证研究
Can Explicit Physical Feasibility Benefit VLA Learning? An Empirical Study
摘要
视觉-语言-动作(VLA)模型将多模态输入直接映射到机器人动作,并且通常通过大规模模仿学习进行训练。虽然这种范式表现出了强大的性能,但流行的 VLA 训练程序并没有明确监督硬物理约束,例如避障或运动学可行性。因此,物理上可行行为背后的几何结构必须只能从演示中隐式推断出来。在本文中,我们研究引入明确的可行性监督是否能为VLA政策提供有效的结构化指导。我们制定了一个简单的基于几何的可行性目标,并将其集成到基于扩散的 VLA 策略的训练阶段。为了系统地评估这个想法,我们使用障碍感知操纵作为依赖于几何形状的物理可行性的受控探针。实证结果表明,通过可行性监督增强 VLA 训练可以提高物理可靠性和整体任务性能,同时还提高低数据条件下的学习效率。这些发现表明,明确的可行性信号可以有效补充基于模仿的 VLA 学习,突显其开发更可靠的 VLA 政策的潜力。