论文
ThinkAfford:杂乱场景中细粒度 3D 基础的以可供性为中心的推理
ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes
摘要
任务驱动的 3D 可供性基础旨在定位杂乱的 3D 场景中的功能区域,从而实现由自然语言指令指定的操作。现有方法要么直接预测 3D 掩模,要么通过选择和融合中间 2D/3D 区域来构造它们。然而,它们仍然容易受到两种相互交织的故障模式的影响:预测或选择的区域可能会错过目标交互区域或具有不合适的粒度,而语言基础可能会混淆关系指令下视觉上相似的替代方案。为此,我们引入了 ThinkAfford,它将高召回率可供性提案的生成与基于指令的推理分离。具体来说,可供性提案生成模块首先使用可学习的可供性提示和多级视觉特征来预测交互条件热图,提取可变数量的细粒度提案,而无需解析对象或零件名称作为分段提示。然后,视觉提示可供性推理使用完整指令对带标签的提案覆盖进行推理,以结构化的“思考然后回答”响应返回标识符。此外,组相关策略优化使用来自提升的 3D 重叠的提案级奖励来使 VPAR 选择与最终 3D 基础保持一致。在 SceneFun3D 验证中,ThinkAfford 在官方评估器下实现了 10.69% AP50 和 25.46% AP25,优于同类 3D 开放词汇和基于视觉语言模型的 2D 到 3D 基线。模块级诊断进一步表明,APG 在 25% 的交集比并集上实现了 77.5% 的召回率,而经过 GRPO 训练的 VPAR 在 APG 覆盖的查询上实现了 72.1% 的选择准确率,而在受监督的 微调 下则达到了 63.4%。