论文

减少现代多模式 大语言模型 管道的峰值内存使用量

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

模型推理KV Cache

摘要

多模态 大语言模型 (MLLM) 最近展示了理解各种视觉输入并生成响应的强大能力,包括高分辨率图像和长视频序列。随着这些模型扩展到更丰富的视觉表示,推理越来越依赖于在键值 (KV) 缓存中存储大量视觉标记,从而使内存消耗成为中心瓶颈。现有方法通过识别视觉词元中的冗余并压缩缓存来解决此问题,但这种压缩通常仅在处理所有输入后才应用,从而导致预填充阶段内存使用高峰。在这项工作中,我们表明 MLLM 表现出固有的结构规律和表征冗余,可用于控制整个推理过程中的内存增长。基于这一见解,我们提出了一种顺序输入压缩机制,通过在预填充过程中执行结构感知的键值缓存压缩来强制执行固定的内存预算。这种方法大大降低了峰值内存使用量,同时保持生成性能,且降幅最小,从而实现更实用、更节省内存的多模态推理。