论文

细分模型能理解世界吗?通过视觉思维链实现主动可供性推理

Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought

模型推理推理策略与问题分解

摘要

最近的分割模型将 大语言模型 (LLM) 与掩码解码器结合起来,将复杂的语言表达式转化为掩码,但它们的指令仍然是目标引用的:它们描述、约束或暗示要分割的区域。然而,在现实世界的具体交互中,人类指令通常处于意图级别,其中包括期望的结果,但没有指定实现该结果的区域。为了弥补这一差距,我们引入了 SegWorld,其中模型在提交遮罩之前通过多层次视觉思维链 (CoT) 对场景进行推理。在收到任何指令之前,它会主动观察场景,描述可见对象并推断它们可能支持的合理事件。给定指令,它会继续这条链:从与意图相关的对象,通过满足意图的动作,到物理交互站点,即提供动作的对象部分。我们将 SegWorld 形式化为概率推理,其中主动观察提供了语言场景上下文,当在意图级别给出指令时,可以改善掩模预测。我们构建了一个意图零件基准,用于评估高层目标的可供性零件分割。实验表明,SegWorld 将指令驱动的基线与目标参考指令相匹配,并在意图级指令上进行了大幅改进。