论文
DAPE:动态非均匀对齐和渐进式细节增强技术,用于提高高效视觉语言模型的性能
DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models
摘要
近年来,预训练的视觉语言模型表现出了巨大的潜力,成为众多下游任务的重要基础框架。然而,文本和图像之间的信息密度并不是均匀分布的。现有方法常常忽视文本标签和图像块之间信息密度和语义范围的固有和动态差异。这些常见的统一对齐策略会导致粗粒度的跨模式交互和精细语义细节的丢失。此外,追求更精细的对齐通常需要大量的计算开销,限制了实际的模型部署。为了应对这一挑战,本文提出了一种具有连续细节引入的动态跨模态对齐的新颖框架。首先,我们设计了一种动态自适应的跨模态匹配机制,该机制使用可学习的匹配函数将不同数量和大小的图像标签动态分配给相同大小但不同信息密度的文本标签,从而实现更精确的注意力交互。其次,我们开发了一个连续的细节引入模块,以逐步将高分辨率视觉特征增强纳入对齐过程。跨多个基准的广泛实验表明,各种下游任务的准确性显着提高,同时减少了计算开销。