论文
PARCEL:使用条件弹性查询进行池锚定重采样,以实现高效的视觉语言理解
PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding
摘要
大型视觉语言模型 (LVLM) 将视觉输入映射到密集的标记序列中,从而为推理带来了二次计算瓶颈。弹性视觉词元压缩通过训练可以在多个视觉 词元预算 上运行的单个模型来解决这个问题。然而,现有的方法在剧烈的压缩下举步维艰。仅空间压缩(如在嵌套池中)表现为不完美的低通滤波器,并会引起频谱混叠,从而模糊细粒度的细节。与嵌套查询重采样一样,仅查询压缩用非局部摘要替换显式的网格对齐标记,并大大降低了空间基础。为了解决这种表征冲突,我们引入了 PARCEL(用于高效视觉语言理解的带有条件弹性查询的池锚定重采样),这是一种视觉标记化架构,可以动态划分特征提取的工作。 PARCEL 将空间池词元建立为低频布局锚点,并通过池条件查询重采样在这些锚点上条件弹性查询词元。这鼓励查询标记关注互补的视觉特征而不是冗余的空间映射。对 27 个基准的广泛评估表明,PARCEL 提高了性能效率帕累托前沿,在视觉 词元预算 上始终优于现有的俄罗斯套娃基线,同时保留了“训练一次,随处部署”范例。