论文
CACR:通过候选人感知的因果推理强化教学视频中的时间答案基础
CACR:Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning
摘要
教学视频中的时间答案基础(TAGV)任务旨在定位响应自然语言查询的精确视频片段,对于直接视频答案检索变得越来越重要。由于需要理解语义上复杂的问题并解决未修剪视频和短目标时刻之间的显着长度不匹配问题,这项任务仍然具有挑战性。现有方法通常对不相关内容敏感或视觉推理能力不足。为了解决这些限制,我们提出了候选者感知因果推理(CACR)框架。我们的方法首先采用基于视觉语言 预训练 的候选选择 (VBCS) 算法来有效生成 K 个候选片段,然后应用由拒绝奖励机制增强的时间逻辑推理模块,并通过组相对策略优化 (GRPO) 进行优化以实现稳健的推理。对六个基准的大量实验表明,我们的方法在平均交并集(mIoU)方面实现了最先进的性能,为长视频中基于推理的检索提供了新的视角。