论文
以视觉为中心的推理的信息正则化注意力
Information-Regularized Attention for Visual-Centric Reasoning
摘要
视觉语言模型(VLM)已成为多模态学习的范例,但由于物体幻觉、视觉证据依赖不足以及全参数指令调整后的灾难性遗忘,仍然不稳定。我们声称这些失败是由于在标准下一个标记预测目标期间缺乏对视觉表示学习的明确控制造成的。因此,视觉嵌入变得被动优化,并且容易注入冗余或虚假信号。为了解决这个问题,我们引入了信息正则化注意力(IRA),这是一种随机注意力机制,可以明确调节注入中间 Transformer 层隐藏状态的视觉信息量。这种局部重新参数化将视觉表示的不确定性转化为跨数据点独立的局部噪声。除了评估模型性能之外,我们还量化嵌入属性,其中 IRA 产生更平滑的曲率轨迹并抑制所有层的注意力下沉,表明视觉信号的转换更稳定。我们的结果表明,随机注意力不仅是正则化器,而且是生成架构中表示学习的关键贡献者,为构建更可靠的 VLM 提供了新方向。