论文
CADER:用于长视频理解的置信度动态证据推理
CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding
摘要
长视频理解越来越依赖于大型视觉语言模型和工具增强推理,但大多数系统无论难度如何,都会对每个示例应用相同的推理过程。这种统一的策略对于简单的问题调用不必要的工具辅助处理,而当困难的问题需要细粒度的时间证据时提供有限的控制。我们提出 CADER(置信度感知动态证据推理),这是一种用于自适应且可靠的长视频推理的 无需训练 框架。 CADER 首先对均匀采样的帧执行全局推理,并使用 logits 裕度信号估计答案置信度,从而允许高置信度示例提前退出。对于不确定的示例,CADER 激活第二阶段工具增强循环,该循环结合了时间裁剪、轻量级语义验证和相关性引导重采样,以逐步定位与问题相关的证据。这种设计将工具的使用视为样本级决策:单个全局传递处理简单的情况,而为不确定性表明需要更多证据的示例保留额外的推理。多个 VideoQA 基准测试的实验表明,CADER 改进了长视频推理,同时绕过了高置信度样本的 Stage~2。此外,当应用于仅通过无工具思想链监督训练的主干时,CADER 实现了与专门的工具增强框架相比的竞争性能,为自适应长视频推理提供了一种实用的推理时间路线。