论文

ParaVT:克服代理视频强化学习中并行工具使用的工具先验悖论

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

模型训练强化学习

摘要

通过强化学习 (RL) 训练大型多模态模型 (LMM) 以原生调用视频处理工具(例如裁剪)已成为理解长视频的一条有前途的途径。然而,现有的原生 RL 方法按顺序调度工具调用(即每轮一次):单个错误裁剪会传播错误而无需对等校正,多轮工具调用损坏的上下文,并且推理成本与轮数成线性比例。我们引入了 ParaVT,这是第一个用于并行视频工具调用的多代理端到端 RL 训练框架,可在单轮中调度多个时间窗口作物,以实现更清晰的上下文和更好的容错能力。然而,将标准强化学习应用于 ParaVT 揭示了一个障碍,我们称之为工具先验悖论:支持工具探索的预训练工具先验也会破坏冷启动结构格式的稳定性,并暴露温度采样下的跳过工具奖励捷径。对较弱先验 LMM 的跨模型对比支持了这一说法:格式保持稳定,但 RL 引发零工具调用,表明先验强度是格式崩溃和工具探索的共同驱动因素。我们提出了 PARA-GRPO(Parseability-Anchored and Ratio-gAted GRPO),它通过两种补充机制增强了标准 RL:(i)仅在最容易崩溃的结构词元位置应用目标格式奖励,以及(ii)按提示帧预算随机化,创建训练提示,在调用该工具时会产生一个可测量的奖励信号而不是跳过它。在六个长视频理解基准中,ParaVT 比 Qwen3-VL 基线平均提高了 7.9%,PARA-GRPO 将训练时间格式合规性从 0.13 提升到 0.64。随着现代 LMM 中工具功能的日益内化,强化学习必须与由此产生的先验进行合作,而 ParaVT 为代理强化学习提供了通用方法。代码、数据和模型权重都是公开的。