论文

FADE:反事实视频理解中从被动验证到主动发现

FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding

模型训练强化学习

摘要

反事实视频理解评估模型是否掌握物理和常识规律。然而,现有的多项选择题(MCQ)基准无意中通过问题和候选选项泄露了目标事件。这减少了从主动发现到文本引导验证的核心挑战。在本文中,我们提出了 FADE,一种用于反事实发现和解释的有效训练框架。我们的方法建立在证据第一、两阶段训练范例的基础上。首先,证据内化的监督 微调 将模型的预测基于决定性的视觉异常。其次,我们应用褪色锚定强化学习策略,逐步消除文本指导,迫使模型独立发现和解释证据。为了严格评估这种能力,我们还引入了一个有效的管道,可以将现有的 MCQ 数据集转换为对齐的 MCQ、开放式问答 (OQA) 和字幕任务,而无需额外的数据管理。我们简单的方法产生了很好的结果。使用 Qwen3-VL-8B 作为基线,FADE 在 DualityVidQA-test 和 IPV-Bench 上的所有三项任务中都取得了最先进的严格配对分数,表现优于 GPT-5.6。具体来说,当从受约束的 MCQ 过渡到不受约束的 OQA 和字幕时,我们的模型表现出了显着的鲁棒性。在 DualityVidQA 测试中,其性能保留率为 90.4% 和 67.4%,大大高于 GPT-5.6 保留的 48.1% 和 30.7%。我们希望这个简单的框架能够成为未来无约束反事实视频理解研究的坚实基础。