论文
MAGE:面向策略性探索与利用的语言智能体元强化学习
MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation
摘要
大语言模型(LLM)智能体在学习过的任务上表现出众,但常难以借助反馈适应非平稳环境。虽然上下文学习与外部记忆提供一定灵活性,但未能内化长期改进所需的自适应能力。元强化学习(meta-RL)把学习过程直接嵌入模型内部,提供了另一条路径。然而,面向 LLM 的既有 meta-RL 方法主要聚焦单智能体场景的探索,忽视多智能体环境所需的策略性利用。我们提出 MAGE,一个赋能 LLM 智能体进行策略性探索与利用的 meta-RL 框架。MAGE 采用多回合训练机制,把交互历史与反思整合进上下文窗口。以最终回合奖励为目标,MAGE 激励智能体基于过去经验改进策略。我们进一步把基于种群的训练与智能体专属优势归一化技术结合,以丰富智能体多样性并保证学习稳定。实验结果表明,MAGE 在探索与利用任务上均超越既有基线。此外,MAGE 对未见对手表现出强泛化,表明它已内化策略性探索与利用的能力。代码见 https://github.com/Lu-Yang666/MAGE。
