论文

PyVision-RL:用强化学习锻造开放 Agentic 视觉模型

PyVision-RL: Forging Open Agentic Vision Models via RL

模型训练强化学习Agentic RL

摘要

面向 Agentic 多模态模型的强化学习常受交互坍缩困扰:模型学会减少工具使用与多轮推理,限制了 Agentic 行为的收益。我们提出 PyVision-RL,一个面向开放权重多模态模型的强化学习框架,可稳定训练并维持交互。该方法将过采样-过滤-排名的 rollout 策略与累积工具奖励相结合,以防止坍缩并鼓励多轮工具使用。借助统一的训练管线,我们开发了用于图像与视频理解的 PyVision-Image 和 PyVision-Video。在视频推理方面,PyVision-Video 采用按需上下文构建,在推理过程中选择性采样任务相关帧,显著减少视觉 token 使用。实验显示出强劲的性能与更高的效率,表明持续的交互与按需视觉处理对可扩展的多模态智能体至关重要。

PyVision-RL:用强化学习锻造开放 Agentic 视觉模型
图5:训练组件的消融实验。我们在不同训练配置下报告七个基准(V* avg@32、HRBench-4K、HRBench-8K、MathVision、MathVerse、WeMath 与 DynaMath)上的平均性能,每种配置各消融我们方法的一个组件。 Ours 设置使用最大轮次预算 4,包含累积工具奖励,对 rollout 组应用标准差排序,并在优势估计中移除标准差归一化项。所有其他设置相对于 Ours 仅修改一个组件。总体而言,我们观察到 (1) 应用标准差排序或移除标准差归一化始终能提升性能;(2) 引入累积工具奖励或增大最大轮次预算会在训练后期带来更大的性能提升。例如,在第 600 步,最大轮次预算为 4 比预算为 2 高出 1.93%。