论文

SkillEvoReg:抑制智能体 Skill 演化过拟合

SkillEvoReg: Regularizing Agent Skill Evolution Against Overfitting

智能体系统Agent Skills智能体自我改进

摘要

语言模型代理通过将执行经验转化为可重用的外部技能来不断改进。然而,重复的技能更新形成了自己的学习过程:本地有用的编辑可能会累积成冗余或特定于任务的指令,而新的更新可能会破坏以前有效的行为。我们将这个问题作为技能进化过拟合来研究,并引入 SkillEvoReg,这是一种受神经网络训练中的防过拟合技术启发的技能进化通用正则化框架。 SkillEvoReg 将训练时技能Dropout(干扰更新生成)、复杂性感知局部正则化(控制不必要的结构增长)与因果反例验证 (CCV) 相结合,为特定候选回归提供有针对性的行为验证。我们跨异构技能进化系统实例化框架,同时保留每个系统的本机技能进化器和任务评估器。在 SkillOpt、SkillEvolBench 和 ContinualSkillBench 中,SkillEvoReg 始终如一地控制技能状态增长,同时保留有竞争力的下游能力,改进多个转移和后期进化结果,并识别仅结构指标无法揭示的更新级别回归。这些结果表明,显式正则化是对能力日益增强的技能更新程序的有用补充。

SkillEvoReg分别在技能更新生成、复杂度和行为验证上加入正则约束。
图2(图注摘要):SkillEvoReg分别在技能更新生成、复杂度和行为验证上加入正则约束。