论文
通过世界知识探索训练 LLM 智能体实现自发的无奖励自我进化
Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration
摘要
如今大多数智能体的“自我进化”都遵循人类定义的奖励与规则。然而这一过程从根本上仍依赖外部监督;没有人类引导,进化就会停止。在本工作中,我们训练智能体具备一种内在的元进化能力,使其在任务执行之前就能自发地了解未见过的环境。为灌输这种能力,我们设计了一种基于结果的奖励机制,衡量智能体自生成的世界知识在多大程度上提升了其在下游任务上的成功率。该奖励信号仅在训练阶段使用,用于教会模型如何有效探索与总结。在推理时,智能体不需要外部奖励或人类指令。它凭借内部参数自发进行原生自我进化,以适应未知环境。应用于 Qwen3-30B 与 Seed-OSS-36B 时,向原生进化的转变在 WebVoyager 和 WebWalker 上带来 20% 的性能提升。最引人注目的是,生成的世界知识甚至使一个紧凑的 14B Qwen3 模型超越无辅助的 Gemini-2.5-Flash,为真正自我进化的智能体确立了新范式。
