论文
语言智能体的政策和内部奖励的共同演化
Co-Evolution of Policy and Internal Reward for Language Agents
摘要
大语言模型(LLM)代理通过与环境交互来学习,但长期训练仍然从根本上受到稀疏和延迟奖励的瓶颈。现有方法通常通过事后奖励归因或外部奖励模型来解决这一挑战,这些模型在推理时提供有限的指导,并且通常将奖励改进与策略改进分开。我们提出了 Self-Guide,这是一种针对语言代理的自我生成的内部奖励,支持推理时指导和训练时监督。具体来说,代理使用 Self-Guide 作为简短的自引导信号来在推理过程中引导下一步行动,并将相同的信号转换为步骤级内部奖励,以便在训练过程中进行更密集的策略优化。这就形成了一个共同进化的循环:更好的政策产生更好的指导,更好的指导进一步改善政策作为内部奖励。在三个代理基准中,推理时间自我指导已经产生了明显的收益,而与 GRPO 共同发展的政策和内部奖励比仅使用环境奖励训练的基线带来了进一步的改进 (8\%)。总的来说,我们的结果表明,语言智能体不仅可以通过收集更多经验来提高,还可以通过学习在行动和学习过程中生成和完善自己的内部奖励来提高。