论文
SceneTeract:探索和改进 3D 室内场景中的智能体感知活动推理
SceneTeract: Probing and Improving Agent-Aware Activity Reasoning in 3D Indoor Scenes
摘要
室内 3D 场景最终是为了使用:实体代理应该能够导航、到达物体并完成各种活动。然而,给定场景是否真正支持特定代理配置文件的这些活动很少得到验证。现有的室内 3D 场景评估通常侧重于视觉质量和语义合理性。相反,活动的可行性取决于几何、特定于代理的约束,例如可达范围、间隙和可用的导航空间。这些属性并没有被视觉合理性指标所捕获,而且正如我们所展示的,越来越多地用于推理 3D 场景的 VLM 通常无法确定单个镜头中动作的可行性。我们提出了 SceneTeract,一个验证接口,它将语义动作理解与物理可行性分开。给定一个场景、一个活动和一个具体的代理配置文件,我们将活动分解为场景对象上的原子操作。然后,显式几何检查决定每个步骤是否可执行,并返回解释故障的诊断跟踪。在合成室内场景中,SceneTeract 揭示了不同代理配置文件中广泛存在的功能和可访问性故障。此外,当根据我们的验证进行基准测试时,我们发现现有的 VLM 系统性地高估了行动的可行性,凸显了对具体功能约束的认识有限。作为回应,我们利用验证者反馈对轻量级 VLM 进行后训练,改进其对物理可行性的评估。尽管仅在合成场景的渲染上进行训练,但我们证明场景理解的改进也可以推广到现实世界的场景。我们将发布验证套件、基准标签和诊断跟踪数据集。