论文

用于隐式视频问答的基于分歧的跨模型路由

Disagreement-Based Cross-Model Routing for Implicit Video Question Answering

模型推理推理验证与自校正

摘要

我们在 ImplicitQA 基准上研究多项选择视频问答,其中正确答案从未明确显示,但必须从屏幕外事件、视线线索、因果结构和交叉镜头空间布局中推断出来。在此基准测试中,单一前沿视频 LLM 的运行已经接近其准确性上限,并且我们观察到传统的自我一致性策略(对同一模型的重复样本进行多数投票)可能会带来伤害而不是带来帮助,因为模型在难题上的错误是相关的。我们提出基于分歧的跨模型路由,这是一种不需要标签和训练的纯粹推理时间过程。我们在零温度下对原生视频模型(Gemini 3.1 Pro Preview)进行三重采样,利用其视频处理管道的真实样本间差异来识别三个样本不一致的大约 20% 的问题子集,并仅将该子集路由到来自不同系列的第二个模型(Claude Opus 4.8),该模型使用自适应思维的均匀采样帧。在公共 真值 的 1001 个问题验证集上——我们的主要评估——该方法将 AvgAcc 比主模型的最佳单个样本提高了 +1.43,每个类别的增益集中在运动和轨迹 (+5.49)、推断计数 (+3.45) 和垂直空间推理 (+1.82)——最依赖交叉镜头参考分辨率的类别。应用于保留的 172 个问题 CVPR 2026 ImplicitQA 挑战测试集的相同管道实现了 82.03 AvgAcc / 79.71 MacroAvgAcc(比主要模型的最佳单个样本高出 1.81),确认了独立分割的验证结果。