论文

用于视频推理的多智能体自我改进强化学习

Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning

模型训练强化学习

摘要

视频证据问答和时间定位等任务需要选择支持查询的时间片段。常见训练通过边界回归或区间生成施加局部监督,验证器主要在推理时为候选片段重排。我们研究冻结验证器是否也能指导训练。多智能体框架组合可训练的证据定位器与冻结验证器:定位器采样候选轨迹和片段,验证器按查询评分;组相对策略梯度鼓励优于同一输入其他候选的轨迹,自举校准损失使时间预测接近验证器偏好的区间。2B模型在源任务训练后,不对目标数据集微调,零样本迁移到证据问答、时间定位和长视频问答。在证据问答基准上交并比为28.7%、答案证据定位准确率为25.4%;时间定位基准交并比为46.1%;长视频问答得分为54.1%。相比同规模强基线,收益较小但一致,交并比和中等重叠召回等相关性指标的改进最明显。所测基准和迁移设置支持把冻结验证用于证据选择训练,同时严格边界精度仍较弱。代码与模型:https://anonymous.4open.science/r/MASIRL-E50C/