论文

TimeProVe:提出并验证日常生活活动中的高效长视频时间推理

TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living

模型推理推理验证与自校正

摘要

长视频问答 (LVQA) 需要在长达数小时的未修剪视频中识别稀疏的、与查询相关的证据。现有方法要么使用大型视觉语言模型(VLM)密集处理视频,从而产生高昂的计算成本,要么依赖基于稀疏图像描述的推理,这通常会错过时间局部和以运动为中心的证据。我们推出了 TimeProVe,这是一种经济高效的混合框架,用于长视频中的时间推理。 TimeProVe 首先采用轻量级模块来生成基于行动的答案——证据假设,然后调用昂贵的 VLM 仅进行有针对性的验证。我们框架的核心在于基于动作的候选证据(ACE)模块,该模块将时间局部动作转换为查询条件的候选答案,并通过轻量级 LLM 推理支持证据窗口。我们进一步介绍 OpenTSUBench (OTB),这是一个开放式基准测试,旨在评估现实世界日常生活活动 (ADL) 场景中的基于时间的推理。实验表明,TimeProVe 的性能比 OTB 上最强的基线高出 7.3%,同时将 VLM 调用减少了 75%,推理成本减少了 93%。此外,在没有明确的时间定位训练的情况下,TimeProVe 在 Charades-STA 上实现了具有竞争力的性能,并且在通过具有定位能力的VLM 进行增强时达到了最先进的结果。