论文
UpstreamQA:视频问答任务显式推理的模块化框架
UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks
摘要
视频问答 (VideoQA) 需要能够对空间、时间和语言线索进行联合推理的模型。然而,任务固有的复杂性通常需要多步骤推理,而当前的大型多模态模型 (LMM) 隐式执行,导致其内部决策过程不透明。相比之下,大型推理模型(LRM)显式生成中间逻辑步骤,增强可解释性并提高多跳推理准确性。然而,这些模型并不是为原生视频理解而设计的,因为它们通常依赖于静态帧采样。我们提出了 UpstreamQA,这是一个模块化框架,可以通过显式的上游推理模块来分解和评估核心视频推理组件。具体来说,我们采用多模态 LRM 来执行对象识别和场景上下文生成,然后将丰富的推理轨迹传递给下游 LMM 以进行 VideoQA。我们使用两个 LRM(o4-mini、Gemini 2.5 Pro)和两个 LMM(GPT-4o、Gemini 2.5 Flash)在 OpenEQA 和 NExTQA 数据集上评估 UpstreamQA。我们的结果表明,引入显式推理可以显着提高下游 VideoQA 的性能和可解释性,但当基线性能足够高时也可能导致性能下降。总体而言,UpstreamQA 提供了一个原则框架,将显式推理和多模态理解相结合,在多种场景下提高 VideoQA 的性能和诊断透明度。