论文

LongVU-TTT:长视频理解中视觉重采样的因果测试时间训练

LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding

模型架构递归架构

摘要

长视频 MLLM 必须在有限的视觉 词元预算 删除大多数帧证据之前对时间变化进行建模。我们引入了 LongVU-TTT,它在视觉编码器和 LLM 之间插入了一个具有因果快速权重更新的卷积测试时间训练 (TTT) 重采样器。其分组的 2D 快速权重适应每个视频,并在压缩前将帧特征置于上下文中,而混合统一和变化感知选择器则为下游推理保留明确的视觉证据。在受控条件下,TTT-Conv 在 MLVU 上比 TTT-MLP 提高了高达 +2.12,在双向 Mamba2 上提高了高达 +3.04,并且在三个基准测试中,它比注意力和固定状态循环重采样器更强。分析表明,快速权重表现为时间聚合状态,而不是可靠的长视野情景记忆:随着证据变得更远,它们的好处会减弱,从而激发显式的帧保留。 LongVU-TTT 可处理多达 512 帧,然后将其减少至 128 LLM 帧,并在五个视频理解基准测试中实现具有竞争力的性能。