论文
自演化何时适得其反?在技能提交前阻断污染
When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents
摘要
自我进化代理通过从其执行轨迹中提炼可重用技能来积累能力,但发现这一过程并非单调:在池大小达到临界值后,新加入的技能反而会降低性能,而不会提升。我们正式化了这一能力污染阶段过渡,并追踪到一个结构性原因:一旦缺陷技能进入决策环境,它就成为后续技能提炼的参考材料,形成跨回合污染链。此外,我们还展示了这种污染是结构性不可逆的:事后移除源技能无法抹去其后代已继承的错误推理,因此回滚后的性能恢复仅能覆盖少量的损失。这使得技能接纳成为提交前的必要检查,而非事后修复,并激发了Verifier-as-Gatekeeper(VaG)的概念:一个逐步信任层级结构,其中三个异质批评者——结构性有效性、行为无害性以及语义一致性——独立地过滤每个技能,同时结合边际收益子集选择法在技能到达运行时上下文之前移除组合性污染。在终端基准2上,无条件积累达到峰值后下降,随着技能池继续扩大而丢掉此前大部分增益,并且随着池大小的增长,回滚移除罪魁祸首技能仅能恢复少量的损失——这是不可逆性的证据。相比之下,VaG每轮都能提升,以约五分之一规模的技能池达到72%的pass@1;其冻结的技能池在不重新进化的情况下转移到四个后端和另一个基准点上。实验性消融验证了三个批评者的互补性和互非替代性,每个都拦截了大量有害技能的不同类群。
