论文
RoboSemanticBench:诊断 VLA 模型动作预测中的语义对齐
RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models
摘要
视觉语言动作(VLA)模型的建立前提是来自预训练语言或视觉语言主干的语义理解应该指导机器人动作预测。然而,机器人 微调 被优化为模仿特定任务的动作分布,并且许多评估可以通过视觉或指令动作快捷方式来解决。我们引入了 RoboSemanticBench (RSB),这是一个用于诊断动作预测中语义对齐的具体基准:训练后的 VLA 模型是否可以使用复杂的指令语义来选择和操作正确的物理目标。在每一集中,机器人都会收到多项选择数学或常识问题,观察候选答案块,并且必须抓住与正确答案相对应的块。 RSB 涵盖受控算术、小学数学理解以及四项选择和十项选择套件下的常识或事实理解。在代表性的 VLA 模型中,我们发现许多策略学习抓取候选块,但在控制抓取成功后以接近随机或低于随机的速率选择语义正确的块,揭示了骨干级语义能力和动作预测之间持续存在的差距。