论文
Afford-VLA:通过内部可供性进行与行动一致的视觉规划
Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance
摘要
视觉-语言-动作(VLA)模型在通用机器人操作方面显示出强大的潜力,但它们仍然受到空间推理不足的限制,特别是在确定复杂视觉场景中的交互位置方面。虽然最近的努力引入了各种形式的视觉规划来解决这个问题,但现有的方法要么依赖于全局几何线索、符号中间表示,要么依赖于外部生成的视觉信号,这些信号通常与下游动作预测弱耦合。在这项工作中,我们重新审视了 VLA 系统中的视觉规划,并认为有效的规划应该是本地的、基于视觉的、内部生成的,并且与行动直接一致。基于这一见解,我们提出了 Afford-VLA,这是一个统一的框架,它将任务条件可供性内化为 VLA 模型中的显式视觉规划界面。具体来说,我们引入可学习的 <AFF> 标记来查询与任务相关的交互区域,从多模态特征中解码可供性掩码,并将它们转换为直接条件动作生成的紧凑嵌入。这种设计使得可供性能够在 VLA 内生成和利用,形成紧密耦合的感知-行动路径。为了进一步支持这种集成,我们采用了一种训练策略,允许功能可供性路径与动作预测联合优化,提高其下游控制的有效性。我们在多个仿真基准(包括 LIBERO、LIBERO-Plus 和 SimplerEnv)上评估我们的方法,实现一致的最先进性能以及强大的现实结果。这些发现表明,将可供性内化为与行动一致的视觉规划,为改进 VLA 系统提供了强大的范例。