论文

将标注作为采样轨迹:视频多模态模型的高效强化学习

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

模型训练强化学习

摘要

多模态大语言模型已成为统一视频感知的主要方式,但多任务后训练仍困难:强化学习组内高质量采样轨迹稀少,即使用昂贵思维链生成也如此。OraRL发现标注不仅可给轨迹评分,还可直接作为标准答案轨迹加入同策略采样组,成为正向优化目标。直接加入高奖励示范会抬高组基线,使原本为正的策略优势反转。OraRL用解耦优势估计处理这一问题:策略轨迹决定不含标准答案的基线,标准答案与策略的差距分别调节方向性增益和独立、停止梯度的标准答案优势。按符号平衡筛选,只保留标准答案及正负两类最强轨迹,训练每步耗时为SFT的2.2倍,不到带思维链GRPO所需4.9倍的一半。方法随模型和数据规模扩展,在0.8B至9B模型及最多10万提示下优于基础模型或GRPO。无需思维链时,Video-ORA-9B解码用时130毫秒而非4780毫秒。相比各任务既有最佳模型,时间定位mIoU从62.5升至66.0、跟踪AO从73.0升至78.2、分割指标从64.3升至70.4,三项空间智能基准平均从51.0升至56.1;VSI-Bench得分73.1,对照GPT-5为55.0、Gemini-3-Pro为55.1。