论文

自演化何时适得其反?在技能提交前阻断污染

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents

智能体系统Agent Skills智能体自我改进

摘要

自我进化代理通过从其执行轨迹中提炼可重用技能来积累能力,但发现这一过程并非单调:在池大小达到临界值后,新加入的技能反而会降低性能,而不会提升。我们正式化了这一能力污染阶段过渡,并追踪到一个结构性原因:一旦缺陷技能进入决策环境,它就成为后续技能提炼的参考材料,形成跨回合污染链。此外,我们还展示了这种污染是结构性不可逆的:事后移除源技能无法抹去其后代已继承的错误推理,因此回滚后的性能恢复仅能覆盖少量的损失。这使得技能接纳成为提交前的必要检查,而非事后修复,并激发了Verifier-as-Gatekeeper(VaG)的概念:一个逐步信任层级结构,其中三个异质批评者——结构性有效性、行为无害性以及语义一致性——独立地过滤每个技能,同时结合边际收益子集选择法在技能到达运行时上下文之前移除组合性污染。在终端基准2上,无条件积累达到峰值后下降,随着技能池继续扩大而丢掉此前大部分增益,并且随着池大小的增长,回滚移除罪魁祸首技能仅能恢复少量的损失——这是不可逆性的证据。相比之下,VaG每轮都能提升,以约五分之一规模的技能池达到72%的pass@1;其冻结的技能池在不重新进化的情况下转移到四个后端和另一个基准点上。实验性消融验证了三个批评者的互补性和互非替代性,每个都拦截了大量有害技能的不同类群。

自演化何时适得其反?在技能提交前阻断污染:论文配图
图 1:无条件技能接纳使进化变得非单调。随着技能的积累,未门控的智能体会不断进步,在临界池大小处达到峰值,然后降级,回馈大部分收益,因为有缺陷的技能既会直接误导智能体,也会成为以后蒸馏的参考背景。之后除掉已确定的罪魁祸首只能挽回部分损失,因为他们的后代仍然存在。 VaG 在进入运行时上下文之前会验证每个技能。当池很小时,它会放弃一点,因为门控也会拒绝一些良性技能,但它会单调改进,并最终超出非门控进化的最佳状态——使用更小、更干净的池。