论文

EVA:端到端视频代理的高效强化学习

EVA: Efficient Reinforcement Learning for End-to-End Video Agent

模型训练强化学习

摘要

由于视频的长词元序列包含广泛的时间依赖性和冗余帧,因此使用多模态 大语言模型 (MLLM) 进行视频理解仍然具有挑战性。现有方法通常将 MLLM 视为被动识别器,在没有自适应推理的情况下处理整个视频或均匀采样的帧。最近基于代理的方法引入了外部工具,但仍然依赖于手动设计的工作流程和感知优先策略,导致长视频效率低下。我们提出了 EVA,一种用于端到端视频代理的高效强化学习框架,它通过迭代总结-计划-行动-反射推理实现感知前规划。 EVA自主决定看什么、什么时候看、如何看,实现查询驱动的高效视频理解。为了训练这样的代理,我们设计了一个简单而有效的三阶段学习管道 - 包括监督 微调 (SFT)、Kahneman-Tversky Optimization (KTO) 和组相对策略优化 (GRPO) - 连接监督模仿和强化学习。我们进一步为每个阶段构建高质量的数据集,支持稳定且可重复的训练。我们在六个视频理解基准上评估 EVA,展示其综合能力。与现有基线相比,EVA 比一般 MLLM 基线实现了 6-12% 的大幅改进,并且比之前的自适应代理方法进一步提高了 1-3%。