论文
当合成数据受到伤害时:LLM 特工技能检索中的灾难性遗忘
When Synthetic Data Hurts: On Catastrophic Forgetting in Skill Retrieval for LLM Agents
摘要
LLM 代理越来越依赖于运行时检索的外部技能,这使得从大型存储库中选择技能成为一项严峻的挑战。我们提出了一个超过 34,396 种技能的生产技能路由器,以及使用有限的真实监督和合成数据进行技能检索的大规模研究。我们发现合成数据 微调 改善了分布内检索,但它会导致真实数据和分布外 (OOD) 数据的灾难性遗忘。我们评估了几种受持续学习启发的遗忘缓解 微调 方法,包括嵌入锚正则化、不遗忘学习 (LwF)、弹性权重合并 (EWC) 和 L2 初始化。结果表明,这些方法不仅保留了 OOD 技能检索的性能,而且将 0.6B Qwen 检索器 和 reranker 的综合分布内技能检索提高了 13.98%。我们的结果为稀缺的、多重积极的监督提供了实用的基准和强大的 微调 配方。