论文

探索更多,减少漂移:只注重结果的强化学习足以满足长期交互式代理的需求

Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents

模型训练强化学习

摘要

强化学习是对 LLM 代理进行后训练的自然方法,用于仅通过任务结束验证来判断的长期交互任务,但人们普遍认为,仅结果的 RL 很快就会在小型开放模型上达到上限。因此,最近的工作通过更密集的奖励、SFT 先验、技能库、策划记忆或多代理编排来补偿训练。我们认为上限是常见做法的两次失败的产物。信号饥饿:仅当任务的轨迹采样组混合成功和失败时,具有稀疏结果奖励的相对于组的强化学习才会产生梯度,因此规模不足的探索恰恰使最困难、最有启发性的任务陷入沉默。策略漂移:从一个小任务池中挤出许多更新会降低策略本身的性能,因为当饱和已经使信息群体变得稀有时,无锚定的目标会让抽样分布崩溃。我们提出了 CANOPY(Coverage-ANchored 同策略 RL),这是一种直接攻击两者的极简协议:扩展相同任务探索直到自然信号重新出现,保持每个更新 同策略、KL 锚定,并仅限于代理自己的操作词元,然后在测试时兑现扩大的交互预算。在长期交互式编码基准 AppWorld 上,仅通过环境交互使用 CANOPY 训练的 Qwen3-14B 策略(没有特定于任务的监督、辅助信用信号或复杂的代理脚手架)位居公共排行榜榜首(2026 年 2 月;测试正常 TGC 86.9,测试挑战 67.6),并且相同的设计原则在 SWE 平台上提升了 Qwen3.5-9B 16.6分。因此,仅代理强化学习就可以将长期能力直接内化到小型开放模型中;我们计划在 https://github.com/AlibabaResearch/SignalCoverageRL 发布完整的训练堆栈。