论文
HIVE:通过分层交叉注意力预训练视觉编码器
Hierarchical Pre-Training of Vision Encoders with Large Language Model
摘要
通过可扩展的视觉编码器和多模态 预训练 框架,计算机视觉领域经历了重大进步。然而,现有方法通常将视觉编码器和 大语言模型 (LLM) 视为独立模块,限制了分层视觉特征的集成。在这项工作中,我们提出了 HIVE(视觉编码器的分层 预训练),这是一种新颖的框架,通过在视觉编码器和 LLM 之间引入分层交叉注意力来增强视觉语言对齐。与扁平化图像嵌入的传统方法不同,HIVE 能够跨多层进行结构化特征融合,从而改进梯度流和表示学习。为了优化这种交互,我们引入了三阶段训练策略,逐步将视觉编码器与 LLM 对齐,确保稳定的优化和有效的多模态融合。实证评估表明,HIVE 不仅在图像分类方面取得了优异的性能,而且在各种视觉语言任务上也取得了优异的性能,在 MME、GQA、OK-VQA 和 ScienceQA 等基准测试中优于基于自注意力的方法。我们的结果强调了分层特征集成的好处,为更高效和更具表现力的视觉语言模型铺平了道路。