论文

从行动指导中学习代理政策

Learning Agentic Policy from Action Guidance

模型训练强化学习

摘要

大语言模型 (LLM) 的代理强化学习 (RL) 关键取决于基础策略的探索能力,因为训练信号仅在其能力范围内出现。对于基础策略无法达到奖励状态的任务,需要额外的训练或外部指导来恢复有效的学习信号。我们不依赖昂贵的迭代监督 微调 (SFT),而是利用日常人类交互中生成的丰富动作数据。我们提出 \textsc{ActGuide-RL},它将行动数据作为计划式参考指导注入,使代理策略能够克服奖励状态的可达性障碍。然后,通过混合策略训练来联合优化引导和非引导的采样轨迹,将探索收益内部化回非引导策略中。在利益-风险权衡的理论和实证分析的推动下,我们采用了最小干预原则,该原则仅将指导作为适应性后备措施,匹配任务难度,同时最大限度地降低 离策略 风险。在搜索代理基准测试中,\textsc{ActGuide-RL} 大幅改进了零 RL(在 GAIA 上+10.7 pp,在带有 Qwen3-4B 的 XBench 上+19 pp),并且在没有任何冷启动的情况下与 SFT+RL 管道执行相同的性能。这提出了一种新的代理 RL 范式,通过使用可扩展的行动指导来减少对大量 SFT 数据的依赖。