论文

LiteFrame:高效视觉编码器解锁视频中的帧缩放 LLM

LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs

摘要

将视频 大语言模型(视频 LLM)扩展到长格式视频的根本挑战在于管理视觉词元上下文长度的爆炸。现有策略主要关注“事后”标记减少——在特征提取后减少视觉标记,以减轻 LLM 的计算开销。虽然这些方法有效地减少了视觉标记的数量,但我们观察到主要的延迟瓶颈从 LLM 转移到视觉编码器昂贵的每帧处理。为了解决这个问题,我们引入了 LiteFrame,这是一个强大且高效的 Video LLM 视频编码器主干。为了训练 LiteFrame,我们提出了压缩词元 蒸馏 (CTD),这是一种新颖的训练框架,可教导紧凑的学生视觉编码器直接预测由大型教师视觉模型产生的信息密集、时空压缩的表示,从而有效地绕过冗余计算。当与进一步的语言模型适应 (LMA) 相结合时,这种方法会产生新的延迟精度帕累托前沿 - 与 InternVL3-8B 相比,LiteFrame 可以将端到端延迟减少 35%,同时处理多 8 倍的帧,并提高多个基准测试中的平均视频理解准确性。我们的结果展示了在固定计算预算下解锁较长形式视频理解的新潜在途径。