论文
CaST-Bench:视频问答的因果链时空推理基准测试
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
摘要
视频中的因果推理对视觉语言模型 (VLM) 来说是一个重大挑战,因为它需要超越表面感知,更深入地理解因果机制。然而,现有的基准很少提供严格评估这种能力所需的细粒度、扎实的证据。为了解决这一差距,我们引入了 CaST-Bench,它是基于因果链的时空视频推理的基准。 CaST-Bench 提出了复杂的因果问题,需要模型来识别和定位多个时空证据链。通过人类与人工智能的协作流程,我们构建了一个包含 1,015 个视频中的 2,066 个问题的高质量数据集,并通过时间段和边界框轨迹注释了因果链。此外,我们设计了一个具有新颖指标的综合评估套件,不仅可以评估答案的正确性,还可以评估基于视觉证据的推理能力。这种基础对于通过减少虚假相关性来提高准确性以及通过使模型更加透明来增强用户信任至关重要。我们的实验表明,当前的 VLM 难以解决因果问题,这很大程度上是由于它们构建精确且有依据的因果链的能力有限。这凸显了改进未来 VLM 的重要方向。主页:https://fabric-by-toyota.github.io/CaST-Bench。