论文
重新思考自我进化:一种缓解技能过拟合的受限探索-利用过程
Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting
摘要
让大语言模型(LLM)智能体积累并复用过往交互经验,仍是现实应用中的核心挑战。一个有前景的方案是将技能视为可训练状态,并像神经网络训练中的模型参数那样对其进行优化。然而,数据驱动的技能优化容易过拟合于从真实环境收集的有限轨迹。过度利用这些轨迹会导致对当前批次过拟合,而无约束的探索则会使此前已解决的案例出现回退。这种张力促使我们以受限搜索的视角看待技能自我进化,由探索-利用权衡所支配。我们提出SkillBoost,一个缓解上述两类风险的三阶段框架:结构化利用将观察到的失败定位到可编辑的技能组件,先验引导的探索借助LLM中的先验知识生成多样的修复候选,经验证的接受仅在候选在回归边界内带来性能提升时才予以提交。在23种模型-基准配置上的实验表明,SkillBoost在缓解过拟合的同时取得了最先进的性能,优于人工编写和LLM生成的技能。迁移实验进一步表明,优化后的技能可被其他智能体在相似任务上复用。
