论文
TimeThink:用时间推理视频 LLM
TimeThink: Reasoning with Time for Video LLMs
摘要
视频推理需要模型来识别和验证长视频序列中的时间局部证据。最近的视频 大语言模型 (Video-LLM) 在与强化学习结合时表现出了有希望的推理能力,但现有方法通常依赖于基于结果的奖励,仅监督最终预测。这种监督对于模型如何在中间推理过程中发现相关的时间证据提供了有限的指导。在这项工作中,我们提出了 TimeThink,这是一个强化学习框架,它明确指导 Video-LLM 中的时间证据发现。我们的关键思想是将时间线索步骤视为视频推理的基本优化原语,其中每个推理步骤都引用视频中的候选时间间隔。我们引入了一种逐步的时间过程奖励,为这些线索提供本地化的信用分配,并引入了一个联合过程-结果优化目标,以平衡推理保真度与任务正确性。为了实现可扩展的训练,我们构建了 TimeThink-RFT-20K,这是一个具有自动派生的时间证据片段的数据集。视频推理、时间定位和通用视频理解基准的大量实验表明,TimeThink 持续改进时间定位和推理性能,在开源视频 RL 模型中实现了最先进的结果。