论文
SEAL:智能体和学习环境的协同共同进化
SEAL: Synergistic Co-Evolution of Agents and Learning Environments
摘要
大语言模型 (LLM) 智能体通过交互不断得到改进,但大多数自我进化方法要么孤立地适应策略或学习环境。我们将这种结构性差距定义为 \emph{智能体与环境错位}:智能体的能力边界在训练期间发生变化,而提供监督的环境保持静态或仅与智能体所揭示的故障弱耦合。我们提出了 SEAL,一种用于交互式工具使用代理的闭环共同进化框架。 SEAL 在可执行验证下收集 同策略 轨迹,将失败的采样轨迹诊断为回合级故障标签,并将这些诊断用作环境端适应和模型端策略优化的共享信号。该环境通过暴露更清晰的工具可供性线索、约束信息和面向恢复的反馈来发展其训练时学习界面,同时通过诊断引导的优势重新加权来更新策略。分布内和分布外多轮工具使用评估的大量实验表明,SEAL 改善了低资源代理的学习:仅使用 400 个训练样本,它就在三个主干上产生 +8.25 至 +26.25 的平均点增益,并表现出积极的分布外迁移。这些结果证明了联合调整学习器及其训练时学习基础对于强大的自我改进 LLM 智能体的价值。