论文

A3R:通过 3D 高斯场景中的跨维度证据进行主体可供性推理

A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes

智能体系统Agent 规划

摘要

3D 高斯场景中的可供性推理旨在识别支持复杂环境中给定文本指令指定的动作的区域。现有方法通常将此问题视为静态场景观察的一次性预测,假设已经有足够的证据可用于推理。然而,在复杂的3D场景中,许多失败案例并不是由于预测能力较弱而产生的,而是由于在固定观察下与任务相关的证据不完整造成的。为了解决这个限制,我们将细粒度可供性推理重新表述为一个顺序证据获取过程,其中通过互补的 3D 几何和 2D 语义证据逐渐减少歧义。在此基础上,我们提出了 A3R,一种代理可供性推理框架,使基于 MLLM 的策略能够迭代地选择证据获取操作,并通过跨维度证据获取来更新可供性信念。为了优化这种顺序决策,我们进一步引入了基于 GRPO 的策略学习策略,可以提高证据获取效率和推理准确性。场景级基准的大量实验表明,A3R 始终超越静态一次性基线,证明了代理跨维度证据获取在复杂 3D 高斯场景中进行细粒度可供性推理的优势。