论文

具有大型视觉语言模型的基于词元的可供性定位

Token-Based Affordance Grounding with Large Vision-Language Models

应用与实践视觉感知与空间理解

摘要

可供性定位旨在定位支持特定动作的图像区域,作为身体智能和具体感知的核心能力。以前的研究主要依赖于使用来自外心图像的动作标签的弱监督学习。然而,这些方法常常难以处理包含同时发生的动作的视觉上模糊的外心图像。此外,它们无法区分语义上相似的动作,因为现有方法通常依赖于简短的动作短语,而这些短语缺乏用于特定动作定位的丰富语义细节。尽管大型视觉语言模型(LVLM)编码丰富的动作语义,并且它们的动作条件文本输出隐式包含空间线索,但它们并不直接提供特定于动作的空间定位。为了解决这些问题,我们提出了 TokAG,这是一种零样本可供性定位框架,它利用 LVLM 中的 词元级 语义空间信号来定位与动作相关的区域,而无需外部监督。我们观察到,与不同 LVLM 输出标记相关的注意力图差异很大,其中许多关注于不相关的区域,例如背景。因此,我们引入了一种空间感知标记选择机制来系统地评估每个输出标记,并选择其注意力图对目标对象表现出主导激活的标记,而不是依赖于任意注意力图。通过提取这些以对象为中心的注意力图,我们将 LVLM 的隐式语义信号转换为零样本可供性热图。我们的零样本框架在多个基准测试中始终优于先前的弱监督方法,在 AGD20K 的未见分裂上将 NSS 提高了 10.7%,在 HICO-IIF 上提高了 29.7%。代码和模型将公开。