论文
VideoQA 中细粒度证据梳理的反事实推理
Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA
摘要
视频多模态模型的最新进展显着提高了 VideoQA 性能。然而,这些系统通常依赖于虚假的统计相关性,而不是与答案相关的因果证据,从而导致不忠实且脆弱的推理,尤其是在复杂的现实场景中。现有方法要么依赖于跨模态相关性、昂贵的训练资源,要么依赖于因果假设和约束不足,并且通常在时间间隔级别上运行。因此,他们无法明确地将因果视觉线索与混杂因素分开,并提供有限的细粒度证据定位。为了解决这个问题,我们提出了一个用于细粒度证据解缠的反事实推理框架(CREDiT)。 CREDiT 使用结构因果模型制定 VideoQA 流程,并学习跨模态表示,这些表示在独立性和最小性约束下显式分解为因果和非因果分量。为了促进忠实的解开,我们引入了特征级因果干预,并构建了反事实输入,以近似因果效应,同时抑制非因果相关性。对 NExT-GQA、SportsQA 和 SPORTU-video 的大量实验表明,CREDiT 在通用和复杂的运动场景中持续提高答案准确性和推理可靠性,从而产生更值得信赖的 VideoQA 系统。