论文
通过超过 128K 上下文的泛化有效训练长上下文视觉语言模型
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
摘要
长上下文建模正在成为现代大型视觉语言模型 (LVLM) 的核心功能,支持跨长文档理解、视频分析和代理工作流程中的多轮工具使用的持续上下文管理。然而,实用的训练方法仍未得到充分探索,特别是在设计和平衡长上下文数据混合方面。在这项工作中,我们对 LVLM 的长上下文连续 预训练 进行了系统研究,将 7B 模型从 32K 上下文扩展到 128K 上下文,并对长文档数据进行了广泛的消融。我们首先证明长文档 VQA 比 OCR 转录更有效。基于这一观察,我们的消融进一步产生了三个关键发现:i)对于序列长度分布,平衡数据优于以目标长度为中心的数据(例如128K),这表明长上下文能力需要跨不同长度和位置的可概括的关键信息检索; ii) 检索仍然是主要瓶颈,有利于任务多样性的适度推理数据和大量检索的混合; iii) 纯长文档 VQA 在很大程度上保留了短上下文功能,这表明指令格式的长数据减少了对短数据混合的需求。基于这些发现,我们引入了 MMProLong,它是通过从 Qwen2.5-VL-7B 中仅使用 5B-词元预算 的长上下文连续 预训练 获得的。 MMProLong 将长文档 VQA 分数提高了 7.1%,并在超出 128K 训练窗口的 256K 和 512K 上下文中保持强劲性能,无需额外训练。它进一步推广到基于网页的多模式针检索、长上下文视觉文本压缩以及无需特定任务监督的长视频理解。总的来说,我们的研究为推进长上下文视觉语言模型建立了实用的 LongPT 配方和实证基础。