论文
编写、执行、完善:通过执行反馈的强化学习从技能追随者到技能优化者
Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback
摘要
专家编写的自然语言技能可以提高代理使用工具的能力,但代理编写的技能比不使用技能的表现要差 8-11 分。这一差距表明,遵循程序指导并根据执行证据改进它是不同的能力。推理时间循环可以修复技能,但不能改进编写下一个技能的模型。我们研究如何将执行经验从中级技能组织到优化器的训练状态。我们引入了 WER(写入、执行和优化),这是一个多阶段框架,可在冻结执行器之外训练技能优化器。优化器提出技能,冻结代理重复执行每项技能,程序验证器对结果进行评分。这些分数提供相对信用并选择混合结果记录。这些记录中匹配的成功和失败轨迹形成了下一阶段的细化状态,因此优化器可以从其早期输出的结果中学习。在 BFCL v4 多回合和 tau2 基准上,WER 相对于无技能基线分别提高了平均 Pass@1 7.80 和 3.85 分。在相同的细化工作流程下,它的性能比没有优化器训练的相同主干网络高出 9.35 和 10.29 分。经过训练的 4B 优化器在 BFCL v4 上达到 76.63%,平均优于所有评估的用作技能优化器的现成通用模型。