论文
用于视频推理的潜在视觉缓存
Latent Visual Cache for Video Reasoning
摘要
视频推理要求大型多模态模型(LMM)保持基于密集证据,但现有系统大多采用“一次读取,多次生成”范式,其中视觉基础在生成过程中减弱。这种现象已被广泛观察到,被称为视觉锚定衰减。为了填补这一空白,我们引入了潜在视频缓存(Latent-VC),这是一种插入到解码器中的循环潜在视觉缓存,用于在整个推理过程中保留紧凑的视觉记忆。缓存通过受监督的对比缓存对齐和具有潜在视觉定位奖励的基于视觉的 GRPO 进行训练,同时通过本机解码器隐藏状态保持严格的训练推理对齐。 Latent-VC 基于 Qwen3.5-9B 构建,在六个视频基准测试中始终优于强大的 CoT 和 SFT+GRPO 基线,尤其是在高度依赖视觉证据的和长视频任务上取得了特别明显的进步。此外,它还以更短的响应实现了更高的准确性,这表明潜在的视觉缓存通过保留视觉证据而不是依赖更长的文本链来改进视频推理。