论文
焦点:通过视觉支持约束和策略优化强制上下文对象本地化
FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization
摘要
上下文定位 (ICL) 旨在定位由查询图像中的一小组支持示例指定的目标对象,无需训练或参数更新即可动态操作。尽管视觉语言模型 (VLM) 取得了快速进步,但实现类别不可知且基于视觉的 ICL 仍然是一个悬而未决的问题,尽管它对于图像编辑、个性化视觉搜索和检索等应用至关重要。现有的方法很脆弱,并且依赖于显式的类别监督,这不仅限制了在具有未命名或特定于实例的对象的现实环境中的适用性,而且还引入了类别偏差,导致预测转向语义先验而不是视觉证据。我们引入了一个两阶段训练框架,可以在没有类别监督的情况下显式优化支持边界框和查询图像之间的上下文注意力。我们使用组相对策略优化(GRPO)通过强化学习进一步完善本地化,以直接最小化本地化错误。这种表述增强了语义先验的视觉对应性,从而产生了强大的实例级本地化。根据经验,根据我们的目标训练的 7B 参数模型优于最多 72B 参数的模型,这表明上下文感知的本地化目标可以超越单独的缩放。综合消融验证了每个组件的贡献。