论文
Affordance2Action:实时操作的任务条件场景级可供性定位
Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation
摘要
任务条件操作需要对与任务相关的功能部分而不是对象类别进行基础指令。此设置与场景相关,并且在杂乱的场景中通常是一对多:同一对象可以提供跨任务的不同交互,而单个任务可能对应于一个功能区域或多个有效功能区域,具体取决于场景布局。现有的可供性数据集和基准仍然与此设置不一致,因为它们通常专注于抓取或对象级可供性,依赖于合成场景,或假设单个指令区域对应。我们提出了 Affordance2Action (A2A),这是一个以基准为中心的学习框架,用于场景级、任务条件零件可供性定位。其核心是 A2A-Bench,这是一个面向操作的基准,涵盖日常场景中的单区域和多区域指令对应,后者强调了现实多对象环境中可供性定位的模糊性和多样性。为了大规模构建它,我们构建了 A2A-AffordGen,这是一个代理辅助注释管道,结合了语言模型过滤、交互式部分分割、实例级掩码优化、任务推理指令生成和人工验证。 A2A-Bench的监督进一步支持多样化的下游应用,其中实时可供性定位和可供性条件操纵策略是两个代表性的例子。实验表明,A2A 在通用分割、基于 VLM 的基础和可供性 蒸馏 基线方面暴露出巨大的差距,同时改进了任务级定位并为下游操作提供有用的空间先验。所有数据集和代码都将公开发布,以促进开放研究。