论文
超越视觉 CoT:主动视频推理的内化视觉思维
Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
摘要
多模态 大语言模型 越来越多地使用视觉思维链 (Visual CoT) 来推理空间、时间和具体环境。通过生成中间推理图像,Visual CoT 为视觉预见提供了直观的机制,但引入了大量的推理开销,这对于主动视频推理来说尤其成问题。我们询问模型是否可以在训练过程中学会视觉思考,同时在推理时直接进行推理。我们引入了内部化视觉思维(IVT),这是一个 后训练 框架,可联合优化未标记视频的文本预测和下一个嵌入预测。给定部分观察到的视频,IVT 可以预测未来帧的潜在表示以及目标文本答案,从而鼓励模型捕获运动、对象转换、交互和潜在意图。在推理时,IVT 直接生成答案,无需合成或重新编码未来的帧。我们对目标表示、解码器设计、预测范围、数据混合、训练课程和预测目标进行对照研究。 IVT 在所有六种评估设置上都比直接答案 微调 有所改进,同时保留相同的推理路径。与显式 Visual CoT 相比,IVT 实现了相当或更好的性能,并将平均端到端延迟降低了 5 倍以上。总之,我们的研究结果表明,在视觉思维链中使用的推理时的显式像素空间生成对于有效的主动视频推理可能不是必需的。预测世界建模可以在训练过程中内化,以产生更准确、更高效的多模态推理器。