论文
感知第一:具有自洽性的隐式视频问答前沿原生视频模型
Perception First: A Frontier Native-Video Model with Self-Consistency for Implicit Video Question Answering
摘要
我们描述了我们向 VRR Challenge @ CVPR 2026 提交的内容,该挑战基于 \emph{ImplicitQA} / \emph{VRR-QA} 基准~\cite{implicitqa}:多项选择视频问答,其中答案在任何单个帧中故意 \emph{not} 可见,并且必须从创意视频不连续帧的空间布局、运动、深度、视角、因果关系和社交背景中推断出来。我们进行了一项系统的 无需训练 研究,涵盖开源 Video-LMM(Qwen2.5-VL~\cite{qwen25vl}、Qwen3-VL~\cite{qwen3vl}、InternVL3、Gemma-3 和 RL 调整的视频推理机 Video-R1~\cite{videor1} 和 VideoChat-R1.5~\cite{videochatr15})和一系列推理时策略(思维链、问题分解、描述然后推理级联、音频转录、空间状态提示、自我一致性~\cite{自我一致性}、多模型集成和类别路由)。我们的中心发现是,这个基准是\emph{感知受限而不是推理受限}:推理端增强是中性到有害的,而基础模型感知能力和轻量级测试时去噪是唯一可靠的杠杆。每个类别的错误分析将困难定位于底层感知——相对深度、视点和计数是最难的类别,而因果和社会推理几乎已解决——并且明确注入单眼深度线索来攻击最弱类别的提示\emph{降低}测试精度$5.8$点,确认模型需要更好的\emph{感知},而不是更好的\emph{程序}。