论文
SpatialAfford:教导紧凑型 VLM 在哪里寻找和在哪里寻找可供性
SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance
摘要
可供性基础旨在定位交互的功能区域,例如抓握的手柄或按下的按钮,而不是整个对象。这使得它比通用视觉基础更具挑战性,因为目标区域更小、更模糊并且更依赖于任务上下文,特别是对于在具体设置中使用的紧凑视觉语言模型(VLM)而言。最近的序列级监督和强化学习提高了坐标预测质量,但紧凑的自回归 VLM 在坐标生成之前仍然缺乏可靠的可供性感知视觉焦点:该模型可以产生更好的坐标标记,而其跨模式注意力仍然分散且弱锚定于真正的可供性证据。为了解决这个问题,我们提出了 SpatialAfford,这是一个两阶段框架,首先通过空间注意力对齐(SAA)将注意力集中到 真值 可供性区域,然后使用 Spatial-Aware GRPO 细化坐标预测。通过在优化落地位置之前明确教导模型要查看何处,SpatialAfford 将可供性落地从纯粹的输出受限目标转变为基于注意力的空间推理。在 ShareRobot-Bench、ReasonAff 和 PartAfford 中,SpatialAfford 不断改进可供性基础,紧凑的 4B 模型优于更强的 7B+ 基线。