论文

预见到地面:从预测时间感知到视频时间地面的证据驱动推理

Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding

模型推理推理策略与问题分解

摘要

当前用于视频时序定位 (VTG) 的 Video-LLM 方法通常依赖于从非结构化视觉词元流直接生成时间戳,这通常会导致脆弱的数字和不一致的边界。为了解决这个问题,我们提出了 Foresee-to-Ground (F2G),这是一个将 VTG 重新表述为可验证的识别然后测量问题的框架。 F2G 将预测时间感知与证据驱动推理相结合:它学习边界敏感的时间表示来构建候选事件片段的视频范围证据池,并将这些片段作为可引用的证据单元暴露给 LLM,将边界预测与显式事件假设绑定起来。通过将事件识别与精确边界测量分离,F2G 可以稳定基础并使预测可验证。大量实验表明,F2G 在不同基准测试中持续提高时序定位精度,在不同 Video-LLM 主干网之间稳健迁移,并保留一般视频理解能力。