论文

ENCORE:熵引导裁剪和注意力正则化以实现鲁棒视觉——语言理解

ENCORE: Entropy-Guided Cropping and Attention Regularization for Robust Vision--Language Understanding

模型训练监督微调与指令调优

摘要

视觉语言模型 (VLM) 在各种视觉语言任务上表现良好,但基于 Transformer 的视觉编码器将图像分割为固定分辨率的子图像,从而损害了轻量级 VLM 中的对象完整性。现有方法仅关注视觉形态,无法动态保留提示相关区域的完整性,从而限制了性能。在这项工作中,我们观察到跨模式注意力的早期层图像文本熵与答案基础质量和任务准确性密切相关。基于这一发现,我们提出了 \textbf{ENCORE},一个由两个组成部分组成的熵引导框架:在推理时,\textbf{基于熵的裁剪策略} (ECS) 评估一小组候选作物并选择熵最小的作物,保留与提示相关的连续区域。在训练时,\textbf{熵正则化训练}(ERT)通过熵项增强了下一个标记的预测,该熵项增强了对关键视觉标记的注意力,同时降低了不相关标记的权重。对 10 个 VQA 基准测试的实验表明,ENCORE、微调 仅使用 0.14% 的参数,实现了平均 1.43% 的准确度增益,并且在最新的 2B 参数 VLM 中实现了最先进的性能。我们的代码发布在https://github.com/baokou-fw2/ENCORE。