论文
PyVision-RL:用强化学习锻造开放 Agentic 视觉模型
PyVision-RL: Forging Open Agentic Vision Models via RL
摘要
面向 Agentic 多模态模型的强化学习常受交互坍缩困扰:模型学会减少工具使用与多轮推理,限制了 Agentic 行为的收益。我们提出 PyVision-RL,一个面向开放权重多模态模型的强化学习框架,可稳定训练并维持交互。该方法将过采样-过滤-排名的 rollout 策略与累积工具奖励相结合,以防止坍缩并鼓励多轮工具使用。借助统一的训练管线,我们开发了用于图像与视频理解的 PyVision-Image 和 PyVision-Video。在视频推理方面,PyVision-Video 采用按需上下文构建,在推理过程中选择性采样任务相关帧,显著减少视觉 token 使用。实验显示出强劲的性能与更高的效率,表明持续的交互与按需视觉处理对可扩展的多模态智能体至关重要。
