论文

通过代理模型引导的求解与复现实现技能自我演化

Self-Evolving Skills via Surrogate-Guided Solve-and-Reproduce

智能体系统Agent Skills

摘要

座席技能是座席在部署时参考的可移植指令和资源包。今天,自我进化在两个方面失败了。首先,从头开始进化的技能表现不佳,并且在弱模型上根本不使用任何技能。其次,进化时间过程记录了一个新的随机代理在部署时通常无法重现的幸运轨迹。我们推出了 reSolve,这是一个基于三个组件构建的基于任务的 Oracle-in-the-loop 框架。它将交互式解决方案与在新容器中独立重新执行的独立交付成果解耦,我们将这种协议称为“解决并重现”。它通过无法访问隐藏测试或参考答案的代理验证器来增强稀疏奖励信号。然后,它在解决方案构建图上运行验证者引导的波束搜索。在固定的安全带内,廉价模型的自我进化技能达到 $74.9\%$ 3 均值,比 $60.1\%$ 人工策划基线 $+14.8$ 点,超过了最强的官方策划技能结果($67.3\%$,GPT-5.5/OpenHands)。我们还报告观察到的失败案例和领域级结果,包括 14 项自然科学任务的表现,以阐明该方法何时有效、何时无效。

通过代理模型引导的求解与复现实现技能自我演化:论文配图
图1:再求学通过五阶段解析和再生成循环,开发出一套技能。最高一排沿着一位候选人走过了第1-5阶段,即任务和任选锚定、交互式作者、被新代理方冻结的再次执行、双重评价(代名词分数和隐藏分数)以及搜索控制。完整的通行证会返回冷冻的技能。否则,光束将顶级候选人保留在Rbloytilde{R}之下,并加以改进。A小组详细介绍盲人核查员如何生成和运行可执行的检查,B小组则说明搜索配置(m=4m4、B=2B2、K=2K2、D=2D2,最多12次评价)。