论文

VepAgent:通过工具增强强化学习来桥接因果转换以进行视频事件预测

VepAgent: Bridging Causal-Transition via Tool-Augmented Reinforcement Learning for Video Event Prediction

应用与实践视觉感知与空间理解

摘要

多模态大语言模型 (MLLM) 在视频理解方面表现出了巨大的潜力,但它们对回顾性总结和以文本为中心的先验的依赖往往限制了它们在应用于视频事件预测 (VEP) 时桥接未观察到的因果转换的能力。为了解决这个问题,我们提出了 VepAgent,这是一个Agentic框架,它将因果转移推理与工具增强强化学习 (RL) 相结合,以实现强大的 VEP。与先前从历史依赖关系中被动预测未来轨迹的方法不同,我们的方法明确地模拟了从最终观察状态到未来事件的逻辑进展。具体来说,我们首先构建 futurebench-4K,这是一个用于监督微调 (SFT) 的高质量思维链数据集,它通过构造未观察到的中间状态的推导来有效地弥合因果逻辑差距。随后,我们开发了一个集成状态跟踪、帧检索和区域放大的诊断工具库,使智能体能够利用外部工具动态增强推理,以恢复丢失的时空证据并解决推理过程中的视觉歧义。此外,我们提出了一种复合奖励机制,共同优化预测准确性、因果一致性和可靠的先验,迫使智能体依赖真正的视觉证据支持而不是表面的文本相似性。对 FutureBench 和 NEPBench 数据集的广泛评估表明,我们的方法实现了最先进的性能,显着优于更大的MLLM,并验证了我们的Agentic(面向未来的推理范式)的经验有效性。

VepAgent:通过工具增强强化学习来桥接因果转换以进行视频事件预测的原论文方法或结果图
图 2:VepAgent 的管道。 (i) 通过显式建模从最终观察状态到未来事件的进展来构建工具增强的因果转移 CoT 数据。 (ii) 受监督的微调初始化工具使用和因果间隙推理行为。 (iii) GRPO 在准确性、因果间隙和反先验奖励方面优化了策略。 (iv) 经过训练的智能体动态集成诊断工具,用于视觉定位未来事件预测。