论文

推理前的感知:视频理解和问答的动态潜在推理

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

模型推理推理策略与问题分解

摘要

视频问答需要模型将视觉证据中的语言查询作为基础,并在必要时跨时间对该证据进行推理。现有的方法通常依赖于长文本思想链的基本原理,尽管一旦相关的对象、动作或框架被本地化,许多问题就可以得到回答。我们提出了动态潜在推理(DyLaR),它首先将问题置于一小段感知潜在(编码与查询相关的视觉证据的连续隐藏状态)中,然后在回答之前自适应地决定是否附加推理潜在(在潜在空间中对该证据进行推理的连续思想)。 DyLaR 通过将感知潜伏植根于经过验证的视觉证据中,并将经过验证的基本原理提炼为推理潜伏,然后进行强化学习,进一步细化何时进行推理,从而学习这种行为。在 9 个视频基准测试和 4 个多模态语言模型主干中,DyLaR 提高了相同主干基线的平均准确度,同时每个查询生成的标记少于 20 个。例如,在 Qwen3-VL-4B 上,DyLaR 将 Qwen3-VL-4B-Thinking 的平均准确度从 54.0 提高到 58.2,同时将每个查询的响应长度从 1,220.7 个词元减少到 18.5 个词元。消融进一步表明,扎根感知潜伏、基本原理监督推理潜伏和自适应路由都提高了准确性。