论文

通过世界知识探索训练 LLM 智能体实现自发的无奖励自我进化

Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration

模型训练强化学习

摘要

如今大多数智能体的“自我进化”都遵循人类定义的奖励与规则。然而这一过程从根本上仍依赖外部监督;没有人类引导,进化就会停止。在本工作中,我们训练智能体具备一种内在的元进化能力,使其在任务执行之前就能自发地了解未见过的环境。为灌输这种能力,我们设计了一种基于结果的奖励机制,衡量智能体自生成的世界知识在多大程度上提升了其在下游任务上的成功率。该奖励信号仅在训练阶段使用,用于教会模型如何有效探索与总结。在推理时,智能体不需要外部奖励或人类指令。它凭借内部参数自发进行原生自我进化,以适应未知环境。应用于 Qwen3-30B 与 Seed-OSS-36B 时,向原生进化的转变在 WebVoyager 和 WebWalker 上带来 20% 的性能提升。最引人注目的是,生成的世界知识甚至使一个紧凑的 14B Qwen3 模型超越无辅助的 Gemini-2.5-Flash,为真正自我进化的智能体确立了新范式。

通过世界知识探索训练 LLM 智能体实现自发的无奖励自我进化:论文配图
图 1:自我进化代理范式的进展。左:体验驱动的进化通过预定义的任务和外部奖励更新代理,需要大量的人力来设计这些组件。中:对抗进化采用挑战者-解决者动态,其中一个提出更困难的任务,另一个改进以解决这些任务;虽然任务和奖励是由代理生成的,但合作管道仍然需要人工设置。右图:我们的元学习驱动进化使智能体能够自主探索环境并将其压缩为可重复使用的世界知识以进行适应,从而以最少的人为干预实现无任务和无奖励的范式。