论文

反思性 VLA:上下文中的行动后果使 VLA 泛化

Reflective VLA: In-Context Action Consequences Make VLAs Generalize

智能体系统Agent 环境交互

摘要

大多数视觉-语言-动作(VLA)模型是反应性的:它们根据当前的指令和观察来预测下一个动作,隐含地假设当前的观察完全指定了与动作相关的状态。然而,在具体化控制中,具体实施例的因素(例如相机到机器人的几何形状、机器人校准或系统驱动偏差)通常很难从单次观察中识别出来。因此,反应性策略总体上无法可靠地消除这些因素的歧义,过度适应训练环境并且在部署时泛化性较差。我们提出了 Reflective VLA,它将每个决策都建立在观察-行动-结果三元组的背景下。每个三元组不仅记录机器人观察和执行的内容,还记录场景随后如何变化,公开从动作到观察到的效果的特定于部署的映射。从架构上来说,反射式 VLA 在共享注意力下通过 VLM 路由所有观察模式,因此行动专家直接对过去的三元组和当前的观察进行推理。块因果掩码可实现无泄漏的并行多帧训练,并支持 KV 缓存实时推理。在标准 LIBERO 和 SimplerEnv-Bridge 上,反射 VLA 保留了强大的分布性能。在 LIBERO-Plus 和更难的 LIBERO-Plus-Hard 上的分布转移下,与匹配的反应基线相比,平均成功率提高了 5.4 和 4.2 个百分点。与仅历史基线相匹配的消融进一步表明,行动后果(而不仅仅是额外的上下文长度)是跨环境泛化的关键。项目页面:https://lianqing11.github.io/reflective-vla-page/