论文
EgoAfford:通过以自我为中心的参考细分实现面向任务的可供性基础
EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation
摘要
部件级可供性定位促进了与基本动作相关的功能对象区域的本地化。将此功能扩展到复杂的任务需要将参与对象的语义角色与任务状态一致的视觉观察和多步骤规划连接起来。我们推出了 EgoAfford,一个旨在连接这三个方面的基准。给定以自我为中心的观察和高级桌面任务,模型必须生成剩余计划并分割下一个动作的最多三个组成部分的功能区域:直接对象、工具和目的地。 EgoAfford 包含来自 2,000 个生成的多步骤场景的大约 15,500 个经过人工验证的图像,这些图像被组织为语义对齐的任务完成图像系列,以及 EgoAfford-Real,涵盖 26 个任务的 102 个手动捕获的图像。我们进一步提出 EgoLens,一种具有特定角色掩模解码器的 3B 多模态 大语言模型,作为该联合任务的域内参考模型。对最近的参考分段 MLLM、商业 VLM-SAM2 管道和 EgoLens 的评估强调了下一步推理和行动角色条件部件定位的互补挑战。 EgoLens 在生成的和手动捕获的观察结果上建立了强大的参考性能。 EgoAfford 和 EgoLens 共同为联合研究多步骤桌面任务中的感知和规划奠定了基础。我们的项目页面位于:https://egoafford.github.io