论文

自博弈与技能演化结合:提问、解答并记忆的自演化搜索Agent

Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember

模型训练上下文与知识智能体系统强化学习记忆Agent Skills智能体自我改进Agent记忆

摘要

自学习代理可以生成训练问题,而无需从目标基准中提问,但其课程缺乏持久状态:失败影响梯度,但不明确地塑造未来练习。外部技能记忆保留程序经验,但通常从固定的任务分布中学习。我们引入 \textbf{SESA}(自进化技能增强代理),使程序记忆成为工具增强的搜索自学习中的可变状态。挑战者提出问题,而单独参数化的解决者仅从技能中检索。有用失败被提炼成可重用技能,并写回到记忆中。更新后的记忆改变了解决者的行为和成功,从而改变了挑战者的奖励和未来问题的分布;结果前沿产生新的失败,从而重写记忆。这种双向循环使任务生成和技能记忆共同进化。因为检索到的技能影响策略学习轨迹,其益处可以进入模型参数,同时保留在外部银行中,从而允许无记忆部署和可选的推理时间检索。在七个开放领域和多跳问答基准上,SESA 在 SSP 的平均准确率上超过 1.2-3.2 个点,同时超越统一评估协议下的技能增强 SkillRL 基准 0.9 个点。在 Qwen3 模型上,SESA-Off 保留了 1.8-2.2 个点的改进,而最终技能库则额外增加了 0.5-1.0 个点。这些结果表明,进化中的技能记忆不仅是一个推理时间插件:它改变了策略学习和未来训练分布,同时保留了价值作为可选的外部记忆。我们的代码可在 https://github.com/Zenghuang-Fu/SESA-Self-Evolving-Search-Agents 获取。

自博弈与技能演化结合:提问、解答并记忆的自演化搜索Agent:论文配图
图1:SESA 的概念概览。自拟搜索失败不会被丢弃,而是提炼成可复用技能、存入记忆并反馈给求解器,使下一轮自我对弈转向更难的问题。