论文

VLZip:用于交错长上下文建模的统一视觉和文本压缩

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

上下文与知识上下文工程

摘要

由于自注意力的二次复杂性,视觉语言模型 (VLM) 面临着超长、交错图像文本序列的重大挑战。当前的解决方案要么采取积极的词元修剪,冒着不可逆转的信息丢失的风险,要么采用高效但不太精确的架构,同时在很大程度上忽略同样重要的文本组件。我们引入了 VLZip,这是一个框架,它统一了视觉和文本压缩,以在纯 Transformer 中进行高保真推理。 VLZip 的核心是,分层地将视觉和文本片段提炼为紧凑的、特定于层的“软前缀”,并将它们注入到每个解码器层的隐藏状态中,从而大大缩短注意力序列,同时保留细粒度的全局上下文。为了解决该领域评估不足的问题,我们还引入了 LongVLBench,这是一个源自视频叙事的新基准,需要整体的、叙事层面的推理。大量实验表明,VLZip 在长上下文多模态推理方面实现了领先的性能,能够训练多达 120K 个词元,比基线增加了 6 倍,并且推理超过 280K 个词元,内存显着减少,同时展示了处理多达 2M 个词元的内存可扩展性。通过擅长处理现有方法无法胜任的极端上下文长度,VLZip 为长上下文多模态 AI 建立了高效且强大的新标准。代码可在 https://github.com/ShareLab-SII/VLZip 获取。