论文

SkillOpt-Lite:通过一根 Vibe 线实现更好、更快的代理自我进化

SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe

智能体系统Agent Harness

摘要

虽然自主代理的技能优化已经受到关注,但现有方法依赖于复杂的管道。这就留下了一个尚未解决的基本问题:什么构成了技能优化的最小可行管道,其中每个组件都经过理论或经验必要性证明是合理的?我们通过零阶(ZO)优化将技能优化形式化,将经典对应项(中心差异、信任区域)映射到最近的文献。值得注意的是,与经典 ZO 中的盲目数值扰动不同,技能轨迹充当可解释的调试反馈。基于 Claude Code 哲学和 PAC 学习,我们建立了三个收敛和泛化原则:基于文件系统的轨迹探索、共识属性挖掘和独立验证门控。为了消除冗余,我们提出了 SkillOpt-Lite。它加速了收敛并超越了完整的 SkillOpt:在 GPT-5.5 上将 LiveMath 提高了 +8.8 点,在 GPT-5.4-nano 上提高了 +25.4 点,使 Nano 模型超越了 SkillOpt 优化的标准 GPT-5.4。最后,我们将我们的框架集成到生产 编码智能体 中,就像 VSCode Copilot 一样,使开发人员能够通过一行 vivi 来发展代理技能。因为我们的框架将所有代理组件简单地视为标准可编辑代码,所以这个最小管道自然可以推广到完整的Harness优化(HarnessOpt)。在 SpreadsheetBench 上,HarnessOpt 使 GPT-5.4-nano 能够达到 0.7758 的精度,优于运行标准管道的更大的 GPT-5.5 (0.7620)。代码可在 https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite 获取。