论文

论高效统一视觉语言训练的词元减少极限

On the Limits of Token Reduction for Efficient Unified Vision Language Training

模型优化稀疏化

摘要

统一视觉语言模型(VLM)将视觉理解和视觉生成集成在单个自回归主干中,但它们的联合训练计算成本昂贵,并且从效率角度来看在很大程度上被忽视。在这项工作中,我们研究了基于词元缩减的统一 VLM 训练加速的可行性和局限性。通过对分层注意力分配的系统分析,我们发现了一个基本的不对称性:视觉理解表现出大量的后期视觉冗余,而视觉生成在深度上保持对图像标记的持续依赖。在这一观察的指导下,我们设计了特定于任务的加速器,有选择地减少每个目标的图像词元计算。虽然这些方法在孤立的设置中实现了显着的效率提升,但我们在统一训练下观察到一致的协同损失——特定于任务的词元丢弃需要不同的参数路径,并消除了联合优化中通常观察到的相互性能增益。我们的研究结果表明,有效的统一建模需要保留共享的跨任务结构,这凸显了对协同感知加速策略的需求。项目页面:https://chicychen.github.io/TokenReductionUnifiedVLM/。