论文

SteerSeg:用于推理视频分割的注意力引导

SteerSeg: Attention Steering for Reasoning Video Segmentation

上下文与知识上下文工程

摘要

视频推理分割需要从自然语言表达中跨视频帧定位对象,通常涉及空间推理和隐式引用。最近的方法通过提取注意力图并将其用作分割的空间先验来利用冻结的大型视觉语言模型(LVLM),从而实现 无需训练 空间定位。然而,这些注意力图针对文本生成而不是空间定位进行了优化,通常会导致分散且模糊的基础信号。在这项工作中,我们引入了 SteerSeg,这是一个轻量级框架,它将注意力错位视为基于注意力的基础的关键瓶颈,并建议通过输入级调节将注意力引导到其源头。 SteerSeg 将可学习的软提示与推理引导的思维链 (CoT) 提示相结合。软提示重塑注意力分布以产生空间上更集中的地图,而 CoT 派生属性通过将注意力引导到正确的实例来解决相似对象之间的歧义。生成的注意力图被转换为跨关键帧的点提示以指导分割模型,同时使用基于相关性的评分对候选轨迹进行排名和选择。我们的方法冻结了 LVLM 和分割模型参数,并且仅学习一小部分软提示,保留了模型的预训练推理能力,同时显着改善了基础。尽管仅在 Ref-YouTube-VOS 上进行了训练,SteerSeg 在不同的基准上都具有良好的泛化能力,显着提高了 LVLM 的空间空间定位能力。项目页面:https://steerseg.github.io