论文

AffordanceVLA:一种视觉-语言-行动模型,通过可供性感知理解来增强行动生成能力

AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding

摘要

视觉语言动作 (VLA) 模型利用预训练视觉语言模型 (VLM) 的丰富世界知识来实现​​遵循指令的机器人操作。然而,VLM 语义空间和具体控制策略之间的结构不匹配常常阻碍精确感知-动作映射的学习。为了应对这一挑战,我们提出了 \textbf{AffordanceVLA},这是一个统一的框架,引入结构化可供性预测作为面向任务的中间表示,以建立更精确和稳健的感知-动作映射。具体来说,我们通过三个互补的组件逐步对操作先验进行建模:1)\textbf{Which2Act}通过视觉潜在预测来抑制干扰,以对象为中心的基础; 2) \textbf{Where2Act} 通过可供图估计进行 2D 交互定位; 3) \textbf{How2Act} 用于 3D 几何推理以指导操作策略。这些可供性线索提供了空间基础、语义条件和动作耦合的中间表示,从而自然地连接视觉、语言和动作。我们与专业专家将这些模块集成到 Mixture-of-Transformer (MoT) 架构中,并使用三阶段训练策略和渐进式数据课程来训练模型。为了克服机器人数据集中密集可供性标签的稀缺性,我们还开发了强大的自动化数据增强管道。大量的模拟和现实实验表明,AffordanceVLA 在不同的操作场景中都实现了强大的性能。