论文
VLM 是通过自适应测试时间优化进行视频推理的好老师
VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization
摘要
最近的“视频推理”范式利用视频生成模型(VGM)生成时间连贯的视觉轨迹来完成推理任务。尽管最先进的 VGM 在视觉质量方面表现出色,但它们常常难以理解和遵循特定任务的规则,从而导致不同推理场景中的逻辑失败。现有的工作尝试利用视觉语言模型(VLM)作为问题预解决器来生成或完善 VGM 的文本指导。然而,文本描述无法捕捉复杂的时空细节,即使有有效的计划,VGM 也常常难以忠实地执行细粒度或长尾指令。虽然 VLM 作为求解器很困难,但它们拥有强大的感知能力来评估流程约束满意度和最终目标实现情况。利用这一优势,我们引入了范式转变,将 VLM 的角色转变为“教师”。具体来说,VLM 教师提取特定于任务的规则来制定可区分的奖励,通过轻量级 LoRA 模块的测试时在线优化来指导 VGM Reasoner。该策略可实现自适应测试时间优化,并将推理能力扩展到 VGM 的固有边界之外。对符号 (VBVR-Bench) 和通用 (RULER-Bench) 视频推理基准的评估表明,所提出的方法产生了 16.7 点的平均性能增益,在相当的测试时间成本下,大大优于 VLM-as-Solver 范例(+0.4 点)和 Best-of-N 缩放(+2.2 点)。这些发现表明,将 VLM 整合为测试教师为实现泛化视频推理提供了一个有前途的范例。项目页面:https://VLM-as-Teacher.github.io/