论文
通过代理模型引导的求解与复现实现技能自我演化
Self-Evolving Skills via Surrogate-Guided Solve-and-Reproduce
摘要
座席技能是座席在部署时参考的可移植指令和资源包。今天,自我进化在两个方面失败了。首先,从头开始进化的技能表现不佳,并且在弱模型上根本不使用任何技能。其次,进化时间过程记录了一个新的随机代理在部署时通常无法重现的幸运轨迹。我们推出了 reSolve,这是一个基于三个组件构建的基于任务的 Oracle-in-the-loop 框架。它将交互式解决方案与在新容器中独立重新执行的独立交付成果解耦,我们将这种协议称为“解决并重现”。它通过无法访问隐藏测试或参考答案的代理验证器来增强稀疏奖励信号。然后,它在解决方案构建图上运行验证者引导的波束搜索。在固定的安全带内,廉价模型的自我进化技能达到 $74.9\%$ 3 均值,比 $60.1\%$ 人工策划基线 $+14.8$ 点,超过了最强的官方策划技能结果($67.3\%$,GPT-5.5/OpenHands)。我们还报告观察到的失败案例和领域级结果,包括 14 项自然科学任务的表现,以阐明该方法何时有效、何时无效。
