论文
AnchorLoop:借助历史策略参照训练工具Agent
Self-Evolve With a Reference:Anchored Training of Tool-Integrated Agents
摘要
自我进化的工具集成代理从自己的训练循环中生成的任务和反馈中学习。课程代理生成任务,而执行代理通过强化学习从自我一致性信号中学习。然而,仅仅依靠当前执行者的反馈有两个局限性:在完全共识的情况下,群体相对优势消失,而基于不确定性的课程奖励有利于分歧,而不显示生成的任务是否支持进一步的学习。这些限制激发了当前执行器之外的额外参考。我们提出 \textit{AnchorLoop},它引入了前一次迭代执行器的冻结副本作为历史参考,并在训练循环的两侧重用它。对于执行器来说,锚点提供了交叉引用优势,可以根据当前和历史多数答案来评估当前输出。对于课程,它根据抽样多数协议的差异提供了基于协议的参考。由于执行器和锚点在课程训练期间具有相同的参数,因此这种比较可以作为任务选择的代理,而不是版本间改进或正确性的证据。在 13 个推理基准测试中,AnchorLoop 在数学推理上比 Agent0 提高了 2.5%,在一般推理任务上比 Agent0 提高了 2.8%。它还保持了较高的有效优势方差,并在以后的迭代中继续改进,因为未锚定的基线显示收益递减。这些结果证明了在无需外部任务或答案监督的情况下将轻量级历史参考引入自我进化工具集成代理的好处。
