论文
HAFI-VLM:用于诊断和增强视觉语言模型中的视觉感知的频率视角
HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models
摘要
当预测需要细粒度的视觉证据时,视觉语言模型 (VLM) 仍然不可靠。我们发现了一个以前被忽视的原因:光谱响应刚性。尽管图像和任务之间的频率变化很大,但预训练的视觉编码器表现出持久的、编码器特定的分层光谱轮廓,这些轮廓在下游 微调 下仅略有变化。由于预训练的视觉编码器仅接收图像,因此它们无法使光谱提取适应当前查询所需的证据。因此,我们提出了 HAFI-VLM,它引入了任务条件频率路径,同时保留了预训练的语义表示。分层自适应频率注入 (HAFI) 使用文本调制、空间对齐的交叉注意力在多个编码器深度检索互补的低频、中频和高频证据。视觉丰富层适配器进一步重新校准浅层 LLM 注意力,以有效利用丰富的视觉标记。 LLaVA-1.5 和 Qwen2.5-VL 上的实验表明,在一般 VQA、丰富文本理解和幻觉鲁棒性方面取得了一致的改进,优于表示级增强方法和大多数基于分辨率或裁剪的方法,而无需额外的高分辨率编码。机制分析表明,HAFI 恢复了任务相关的频谱分配,同时保留了语义注意力,将频率丰富确立为改善 VLM 感知的独特且有效的途径。