论文

明白我的意思:调整视觉和语言表示以实现视频细粒度对象理解

See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

模型训练监督微调与指令调优

摘要

我们提出了 SWIM(明白我的意思),这是一种新颖的训练策略,可以将视觉和语言表征结合起来,从而仅根据文本提示即可实现细粒度的对象理解。与需要明确视觉提示(例如掩模或点)的现有方法不同,SWIM 仅在训练期间利用掩模监督来引导跨模式注意力,从而允许模型在推理时自动关注用户指定的对象。我们对预训练的多模态大语言模型(MLLM)的交叉注意力分析揭示了一个系统差异:属性词在视觉模态中产生尖锐的局部激活,而宾语名词由于语义参考偏差和分布式高级表示而产生分散和分散的模式。为了解决这种不一致问题,我们构建了 NL-Refer,这是一个丰富的数据集,其中每个对象掩码都与精确的自然语言引用表达式配对。 SWIM 从对象名词中提取多层交叉注意力图,并通过 真值 掩码强制执行空间一致性。实验结果表明,SWIM 显着改善了文本视觉对齐,并在细粒度对象理解基准上实现了优于基于视觉提示的方法的性能。代码和数据可在 \href{https://github.com/HumanMLLM/SWIM}{https://github.com/HumanMLLM/SWIM} 获取。