论文

用于视频关系推理的问题感知证据分类账

Question-Aware Evidence Ledgers for Video Relational Reasoning

模型推理推理验证与自校正

摘要

VRR-QA 挑战评估视频中的视觉关系推理,其中答案通常取决于隐含的空间关系、事件边界、目标身份和对话上下文,而不是单个显着帧。我们提出了一个围绕强大的 GPT-5.5 视频 QA 求解器和一组问题感知证据分类帐构建的测试时推理管道。初始求解器通过统一的视频表示回答每个问题,同时提示路由账本为计数、空间、端点、视点和对话推理明确所需的目标、计数单位、参考帧和时间或空间范围。开放词汇检测、深度提示、配对裁剪、ASR 和场景图账本等外部工具仅用作证据来源。保守门保留当前答案,除非独立证据唯一支持不同的选择。最终的证据门控管道在挑战测试拆分中实现了 92.95% 的总体准确率和 93.79% 的宏观准确率。