论文

EasyVideoR1:更轻松的视频理解强化学习

EasyVideoR1: Easier RL for Video Understanding

模型训练强化学习

摘要

可验证奖励的强化学习(RLVR)在提高 大语言模型 的推理能力方面表现出显着的效果。随着模型演变成原生多模态架构,将 RLVR 扩展到视频理解变得越来越重要,但由于视频任务类型的多样性、重复解码和预处理高维视觉输入的计算开销以及跨众多敏感超参数进行可重复评估的难度,在很大程度上仍未得到探索。现有的开源强化学习训练框架为文本和图像场景提供了坚实的基础设施,但缺乏针对视频模式的系统优化。在这项工作中,我们提出了 \textbf{EasyVideoR1},这是一个完整且高效的强化学习框架,专门用于训练视频理解任务的大型视觉语言模型。 EasyVideoR1 做出了以下贡献:(1) 具有离线预处理和张量缓存的完整视频 RL 训练管道,消除了冗余视频解码并产生 1.47 $\times$ 吞吐量改进; (2) 全面的、任务感知的奖励系统,涵盖 11 种不同的视频和图像问题类型,具有统一的路由和模块化的扩展; (3)混合离线-在线数据训练范式,将精选的高质量轨迹与同策略探索相结合,有利于学习更具挑战性的任务; (4)具有独立配置像素预算的联合图像视频训练,使两种模式相互加强; (5) 异步多基准评估框架,涵盖 22 个主流视频理解基准,再现精度与官方报告的分数紧密一致。