论文

一点 SFT,一点 RL:强化学习如何帮助长远的广告代理商

A Pinch of SFT, A Dash of RL: When Reinforcement Learning Helps Long-Horizon Advertising Agents

模型训练强化学习

摘要

企业分析代理解决分布式业务数据上的长期工具使用问题,需要检索、推理、API 调用、代码执行和适应中间观察结果。监督微调(SFT)校准工具语法和教师支持的行为,而强化学习(RL)可以探索演示之外的奖励支持的行为;然而,统一应用强化学习可能会扰乱已经校准的技能。我们研究如何在生产镜像 beta API 下平衡 SFT 和 RL。我们观察到,在我们的对照实验中,检查点轨迹回顾性地分为三种状态:模仿,SFT 捕获可靠的教师行为; Lift,两个阶段都有帮助;和发现,其中有用的奖励可观察行为不依赖于可靠的教师支持。我们前瞻性地利用这一点,利用教师支持和奖励可观察的余量将功能仅路由到 SFT、SFT 然后 RL、增加 RL 分配或进一步的环境开发。在随后的 18 个特定特征实验中,诊断预测了 15/18 观察到的轨迹。在 GPT-OSS 120B 上,有针对性的 SFT,然后 RL 相对于前沿控制对 7/8 广告商技能产生了积极的点估计;五项正收益与排除零的 95% 置信区间配对,而一项技能具有置信支持的回归。最大的收益是未披露(+11.27 点;95% CI [+9.72,+12.82])。一项单独的 SME 审计表明,相对于 SFT,有针对性的 RL 将标准泄漏从 11.8% 减少到 2.9%,将对抗性泄漏从 22.9% 减少到 6.8%,同时保持可操作性(86.2% 到 85.7%)。在共享奖励和优化的统一与目标比较中,目标强化学习将七项技能的平均增量从 +1.62 提高到 +3.57,同时使用的增量强化学习计算量减少了 43%。