论文

重新思考自我进化:一种缓解技能过拟合的受限探索-利用过程

Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting

智能体系统Agent Skills

摘要

让大语言模型(LLM)智能体积累并复用过往交互经验,仍是现实应用中的核心挑战。一个有前景的方案是将技能视为可训练状态,并像神经网络训练中的模型参数那样对其进行优化。然而,数据驱动的技能优化容易过拟合于从真实环境收集的有限轨迹。过度利用这些轨迹会导致对当前批次过拟合,而无约束的探索则会使此前已解决的案例出现回退。这种张力促使我们以受限搜索的视角看待技能自我进化,由探索-利用权衡所支配。我们提出SkillBoost,一个缓解上述两类风险的三阶段框架:结构化利用将观察到的失败定位到可编辑的技能组件,先验引导的探索借助LLM中的先验知识生成多样的修复候选,经验证的接受仅在候选在回归边界内带来性能提升时才予以提交。在23种模型-基准配置上的实验表明,SkillBoost在缓解过拟合的同时取得了最先进的性能,优于人工编写和LLM生成的技能。迁移实验进一步表明,优化后的技能可被其他智能体在相似任务上复用。

重新思考自我进化:一种缓解技能过拟合的受限探索-利用过程:论文配图
图 2:SkillBoost 概述。顶部:在每次迭代中,冻结的 LLM 代理执行以当前技能 sts_{t} 为条件的任务,并且接受门仅提交经过验证的改进以产生 st+1s_{t+1}。底部:向后优化将失败归因于技能组件(结构化利用),在不同修复策略下生成神经网络候选(先验引导探索),并选择通过门的最高增益候选(验证接受)。