论文

AffordVLA:通过隐式特征对齐将可供性表示注入视觉-语言-动作模型

AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)模型的最新进展显示出通用机器人操作的巨大潜力。然而,大多数 VLA 模型的视觉表示通常以全局对象外观为主,并且很难专注于与任务相关的功能交互区域,这限制了它们在非结构化环境中的鲁棒性。现有的基于可供性的方法通常依赖于显式掩模注入或外部感知模块,需要额外的注释,同时引入级联感知错误和推理开销。为了解决这些限制,我们提出了 AffordVLA,这是一种功能可见性增强的 VLA 框架,它通过隐式表示对齐将以操作为中心的功能可见性感知内化到 VLA 视觉表示中。具体来说,我们构建了一个零样本可供性教师,从 RGB 观察和语言指令中提取任务条件可供性视觉表示。 AffordVLA 将 VLA 的中间视觉表示与教师提取的可供性视觉表示对齐,从而隐式地将以操作为中心的可供性感知注入到 VLA 视觉表示中,并提高动作准确性。广泛的模拟和现实世界实验表明,AffordVLA 及其可供性教师实现了最先进的性能并超越了强大的基线。消融分析表明,AffordVLA 有效地重塑了 VLA 视觉表示,同时保持推理效率,从而提高操作成功率和训练效率。