论文

VLA 知道基础知识吗?测量视觉-语言-动作模型中的常识和世界知识保留

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

模型评测模型能力评测

摘要

体现视觉-语言-动作(VLA)模型通常是通过 微调 强大的预训练 VLM 在机器人数据上获得的,但尚不清楚它们在适应后保留了多少常识和事实知识。知识敏感任务的失败是不明确的,将知识缺失与底层控制的泛化不良混为一谈。我们引入了 Act2Answer,这是一种轻量级协议,通过要求代理通过行动回答来使 VLM 知识基准适应 VLA 评估。每个问题都成为一个简短的桌面情节,其中代理执行单个对象放置动作以在候选答案中进行选择,从而产生基于动作的成功率并减少控制混淆。我们在不同的常识和世界知识类别中策划了此类环境的测试套件,并引入分层意图探测,以跨 VLM 主干和行动头本地化与答案相关的信息。在对 7 个 VLA 模型和 9 个 VLM 基线的大规模研究中,我们系统地对不同类别的模型进行排名,发现 VLA 在简单概念上表现出稳定的性能,同时在更丰富的语义类别上相对于其源 VLM 表现出更大的差距,VQA 协同训练与更好的知识保留相关,并且答案相关信号在中间 VLA 层达到峰值,但在上层衰减。 Act2Answer 可在 https://tttonyalpha.github.io/act2answer/ 上获取。