论文
视频时间定位的时间感知推理优化
Temporal-Aware Reasoning Optimization for Video Temporal Grounding
摘要
多模态 大语言模型 (MLLM) 通过强化学习生成推理路径,在视频时间定位方面取得了显着进展。然而,现有模型常常产生肤浅的推理,这为精确时间定位提供了有限的指导。这种限制源于(1)低效的随机探索和(2)奖励函数只关注答案的正确性而忽略推理质量。为了解决这些问题,我们提出了 TaRO(时间感知推理优化),这是一个显着增强模型随时间思考的能力的框架。首先,我们引入了一种构造性推理探索,它利用预先生成的密集视频描述来构建基于显式视觉线索和时间戳的推理路径,从而能够有效地探索高质量的时间感知推理。其次,为了评估推理质量,我们设计了时间敏感性奖励。高质量的推理应该基于特定的事件和时间戳。如果思考下的事件边界被打乱,这样的推理就会失效,导致推理路径的logits下降。我们利用这种下降作为对推理质量的批评。最后,TaRO 遵循渐进式课程,首先利用该奖励选择更好构建的推理路径,然后发展到模型自主生成有效推理的自由探索阶段。实验表明 TaRO 在 VTG 基准上实现了最先进的性能。代码可在 https://github.com/oceanflowlab/TaRO 获取。