论文
VLA是否理解并适应他们处理的物体,或者只是简单地重演学到的行为?
Do VLAs Understand and Adapt to the Objects They Handle, or Simply Replay Learned Behaviors?
摘要
本文询问VLA泛化是否基于对物体物理属性的全局理解,从而使策略能够使其运动适应看不见的设置,或者策略是否只是简单地重播它们所学到的在新设置中碰巧成功的运动。前者反映了真正的概括;后者反映了偶然的稳健性。我们首先通过对七个VLA的激活应用线性探测和表征相似性分析 (RSA) 来检查对物理属性的认知。我们发现,在几乎所有模态流中,物理属性(包括质量、脆弱性、可变形性、摩擦力和尺寸)比非物理属性(例如语义类别、材料、声音和价格)更难以解码。与它们的基础VLM相比,机器人预训练削弱了语言流中物理属性的线性编码。前训练和下游微调都没有增强物理性质差异和激活距离之间的一致性。然后我们询问这些激活中存在的微弱物理信息是否会影响VLA生成的动作。在受控 LIBERO 案例研究中,我们增加了域内对象的质量,并通过语言或视觉发出变化信号。大多数VLA对较重和原始质量的物体使用类似的提升行为,导致任务成功率下降。少数例外会根据词汇或视觉提示而不是质量本身来改变其行为。这些结果表明,VLA对物理属性的编码较弱,并且不能可靠地使用它们来适应其运动。