论文

RLHarness:程序技能与强化学习共同进化,实现长时域多模态推理

RLHarness: Co-evolving Procedural Skills with Reinforcement Learning for Long-horizon Multimodal Reasoning

模型训练智能体系统强化学习Agent HarnessAgent SkillsRLVR

摘要

多模态推理要求模型通过长决策链保留视觉证据,同时在不同的场景和规则中选择适当的程序。当学习仅由终端验证者引导时,强化学习(RL)揭示最终答案是否正确,但不揭示它应该如何产生。因此,该策略必须在学习执行推理过程的同时发现可重用的推理过程,从而产生程序冷启动问题。技能可以将成功的程序具体化,减少重复探索,并提供可检查的指导。然而,固定的技能库假设该指南与不断发展的策略保持兼容,而单独更新技能可能会使它们的触发器、执行协议和演示陈旧或相互不一致。我们引入了 RLHARNESS,它将技能、选择和执行协议、小样本演示和任务契约组织到一个统一的、版本化的 Harness 中,并将 Harness 演化与策略学习交替使用。探索蒸馏Harness为 SFT 和 DAPO I 构建初始Harness和版本对齐的验证跟踪。在第一个 RL 块之后,后 RL 重建Harness根据新的成功与失败rollout重建技能、协议和演示,并且 DAPO II 使策略适应重建的程序。 RLHARNESS 将 MetroMap/TravelMap 上的准确度从 16.25%/27.50% 提高到 62.00%/50.00%,并将 Fee-VL/Cancel-VL 上的 F1 分数从 37.13%/45.50% 提高到 65.81%/65.51%。所有四项任务只有在重建和 DAPO II 后才能达到最佳结果,这表明不断发展的 Harness 通过不断更新策略学习执行的外部程序来补充 RL。