论文
SceneFunRI:推理任务驱动的功能对象本地化的不可见事物
SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization
摘要
在现实场景中,目标对象可能位于不可见的区域。虽然人类通常可以根据上下文和常识知识推断被遮挡物体的位置,但这种能力仍然是视觉语言模型(VLM)的主要挑战。为了解决这一差距,我们引入了 SceneFunRI,这是 Reasoning the Invisible 的基准。基于 SceneFun3D 数据集,SceneFunRI 通过半自动管道将任务制定为 2D 空间推理问题,包含 855 个实例。它需要模型根据任务指令和常识推理来推断不可见功能对象的位置。最强的基线模型(Gemini 3 Flash)仅达到了 15.20 的 CAcc@75、0.74 的 mIoU 和 28.65 的 Dist。我们将提示分析分为三类:强指令提示、基于推理的提示和空间消除过程(SPoE)。这些发现表明,在当前的 VLM 中,不可见区域推理仍然是一种不稳定的能力,这激发了未来对更紧密地集成任务意图、常识先验、空间基础和不确定性感知搜索的模型的研究。