论文
通过上下文潜在转向引用具有大型多模态模型的多个区域
Referring Multiple Regions with Large Multimodal Models via Contextual Latent Steering
摘要
大型多模态模型(LMM)最近展示了它们在整体视觉理解方面的熟练程度。然而,他们中的大多数人都在努力解决由视觉提示引导的区域级感知,特别是在同时引用多个区域的情况下,或者需要全局上下文来进行精确视觉引用的情况下。我们引入了上下文潜在引导(CSteer),这是一种 无需训练 方法,用于指导一般 LMM 根据上下文引用多个区域,而无需昂贵的 微调 或架构修改。 CSteer 从预计算上下文向量开始,这些向量隐式地表示视觉引用行为,例如区域之间的差异和对全局上下文的关注,然后在推理时间进行表示编辑。多个数据集上的实验结果表明,在大多数情况下,带有 CSteer 的通用 LMM 优于定制的参考 LMM,这表明 无需训练 是一个有前途的解决方案,并为该领域设定了新的最先进技术。代码可在 https://github.com/xing0047/csteer.git 获取。