论文

连接点:通过强化学习通过跨域泛化训练 LLM 长生命周期代理

Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning

模型训练强化学习

摘要

这项工作提出了一个用于训练 大语言模型(LLM)“连接点”(CoD)的通用框架,这是长生命周期代理所需的元能力:当基于 LLM 的 AI 代理部署在环境中时,它会解决一长串任务,同时不断探索环境,从自己的经验中学习,并迭代地自我更新其关于环境的上下文,从而实现根据更新的上下文,在未来的任务中逐步获得更好的性能。 CoD 框架的主要组成部分包括:(1)端到端强化学习(RL)的算法设计和基础设施,具有交错解决任务和更新上下文回合的长采样轨迹序列; (2) 在训练期间激励和引发 LLM 中的目标元能力以及在评估期间忠实衡量进度的任务和环境。我们提出了 CoD 框架的概念验证实现,包括具有细粒度贡献分配的 GRPO 式 RL 算法,以及针对目标元功能(而不是特定于领域的 LLM 功能或标准的逐任务 RL)定制的任务和环境。 Qwen3-8B 和 Qwen3.6-27B 的实证结果验证了 CoD 设置中端到端 RL 训练的有效性,并证明了所引出的元能力的分布外泛化潜力(在训练域内、跨不同域以及从 CoD 到 Ralph 循环设置)。我们对 CoD 的研究将之前的几条工作联系起来,并为推进 LLM 和 AI 代理开辟了新的机会。为了促进进一步的研究和应用,我们在 https://github.com/agentscope-ai/Trinity-RFT/tree/research/cod_v2/examples/research_cod 发布了我们的实现。