论文

BPO:视频MLLM后训练的行为包优化

Behavior Pack Optimization for Video MLLM Post-Training

模型训练强化学习

摘要

视频多模态大语言模型(MLLM)在视频问答基准上持续攀升,但打乱帧、遮蔽支持答案的片段或遮挡目标对象几乎不改变其预测——准确率依赖外观与语言先验而非问题要求的时间证据。我们把它追溯到后训练的单元:奖励在原始剪辑的单个响应上计算,模型从未被要求跨视图保持一致。我们提出行为包优化(BPO):以跨按问题类型选择的反事实视图的输出"行为包"取代单响应并联合打分。包奖励要求:干预无关时稳定、关键证据被移除时敏感、无证据剩余时弃答。为使目标在小包尺寸下稳定,BPO使用锚相对优势:原始视图上的响应作为逐提示参照,而非混合视图的组均值。在TempCompass、MVBench与NExT-QA上,BPO使Qwen2.5-VL-7B-Instruct宏准确率较同SFT检查点、预算匹配的原版GRPO基线提升4.7点,时间难例子集7.8点,弃答F1提升20.0点;增益迁移到Video-MME、LongVideoBench与LLaVA-Video-7B;消融确认增益随视图集而非rollout数。我们希望这种包级视角为走向证据接地的视频推理的视频MLLM与多模态后训练社区提供有用的起点。