论文
具有内存高效解码功能的大型视觉语言模型的注意力感知推理优化
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
摘要
大型视觉语言模型(VLM)在多模态推理方面取得了显着的成功,但由于解码过程中的内存开销,其推理时间效率仍然是一个重大挑战,特别是当 VLM 的查询和答案由长序列的视觉和文本标记组成时。本文提出了 AttentionPack,这是一种专为大型视觉语言模型量身定制的自适应注意力感知优化框架,可提高解码过程中的内存效率,重点解决因视觉输入和交互数量增加而带来的挑战,特别是在具有多个高分辨率图像或视频的长上下文任务中。 AttentionPack 在两个方面具有新颖性:(i)我们引入了一种多头注意力压缩方法,通过利用隐式低秩结构经济地存储键和值矩阵;(ii)我们开发了一种特定于词元的注意力感知解压缩机制以减少延迟开销。多个基准测试的实验结果表明,AttentionPack 将内存效率提高了 8 倍,实现了更高的批量大小和更快的批量推理,同时保持了模型输出质量或更长的上下文长度,以实现卓越的检索性能。我们还报告了 AttentionPack 与逐出、量化和内核融合相结合的有效性,显示了资源有限环境的进一步效率提升。