论文
揭开视觉-语言-动作模型中具身推理的幻想
Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
摘要
最近的视觉-语言-动作(VLA)模型在标准机器人基准上报告了令人印象深刻的成功率,这激发了人们对通用物理智能的乐观态度。然而,最近的证据表明,标准基准成功与真正的体现推理之间存在系统性偏差,引发了这样的问题:这些高分是否反映了真正的认知能力。为了解决这一差距,我们引入了 BeTTER,这是一个用于测试机器人策略中真实体现推理的诊断基准。 BeTTER 应用有针对性的因果干预措施(例如,空间布局变化、时间外推),同时强制执行运动隔离,以明确地将高级推理失败与底层执行限制脱钩。通过系统评估,我们发现最先进的 VLA 在动态场景中会发生灾难性的失败,表现出严重的词汇运动捷径、行为惯性和语义特征崩溃。至关重要的是,我们的机制分析将这些症状追溯到基本的架构瓶颈——例如容量压缩和短视下采样——这些瓶颈系统地降低了模型的基础语义表示。我们证明,高度静态的评估协议通过允许优化过度适应感觉运动先验,有效地掩盖了这种退化。在现实世界的机器人验证的支持下,我们的研究结果证实,这种表征分解不是模拟工件,强调了未来 VLA 范式解决高频控制和高级推理之间的结构紧张的迫切需要。