论文
并非所有技能都有帮助:测量和修复代理知识
Not All Skills Help: Measuring and Repairing Agent Knowledge
摘要
LLM 智能体可以通过从经验中积累自然语言技能而无需权重更新即可进行改进,但当前系统将有关保留哪些技能以及如何应用它们的每项决定仅委托给 LLM 判断。我们认为,这将两个不同的角色混为一谈:从经验中生成技能是一种创造性行为,判断力可以很好地处理,而决定该技能是否真正有帮助则需要跨许多任务的经验证据。通过随机屏蔽来衡量每种技能的因果贡献,我们发现技能库表现出普遍的因果异质性:个人技能通常会帮助某些任务类型,同时伤害其他任务类型,但它们的相反效果总体上会抵消,使它们对全局管理方法不可见。我们提出了 ASSAY,一个将生成与管理分开的框架:它在小型开发集上计算每个技能的因果归因,离线重组库,并抑制对每个测试任务具有负面预测效果的技能。在涵盖四个提供商和两个基准(AppWorld 和 tau-bench)的七个基本模型中,ASSAY 持续改进了以前的技能管理方法。在 AppWorld 最难的分裂中,DeepSeek-V3 实现了 69.3% 的任务目标完成率(47.4% 相对改进),这是包括权重调整方法在内的所有已发布方法中的最新技术水平。在 tau 基准零售上,GPT-4.1 相对提高了 8.7%,在公共排行榜上超越了 o4-mini、o1 和 GPT-4.5,且没有任何权重修改。 Ablation 追踪了每个任务屏蔽的主要增益,确认瓶颈是在推理时将技能与任务匹配,而不是全局消除不良技能。代码可在 https://github.com/aiming-lab/assay 获取。