论文

回归税:分解技能为何有益也有害于LLM智能体

The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents

模型评测智能体系统Agent Skills评测方法与指标

摘要

为 LLM 智能体添加程序性技能通常以任务成功率的平均提升来评估。然而,这一指标掩盖了一项重要代价:技能也可能使智能体变差。我们通过在两个办公自动化基准和三个模型框架栈上近 6,000 次运行中比较有技能与无技能的智能体,来度量这两个方面。这使我们能够区分两种结果。回归是指无技能时解决、添加技能后失败的任务。残余失败是指无论有无技能都失败的任务。我们发现回归的规模之大,以至于表现最好的技能之所以胜过其他技能,主要在于回归更少,而非收益更多。我们识别出回归的三种成因:(i) 技能描述渗透,即技能仅凭存在于上下文中就改变智能体的行为,即使它从未被调用;(ii) 锚定置换,即技能规定的流程覆盖了智能体解读其输入的方式;(iii) 验证置换,即该流程抑制了智能体原本会对自身输出执行的检查。对持续性失败的分析揭示了同样的底层模式。现有技能过度强调程序性指导——这是最不常导致失败的阶段——而对锚定与验证支持不足,后者才是剩余错误的主要来源。在修正评估工件并研究轨迹之后,我们发现许多回归和持续性失败可以通过更好的锚定与验证来挽回。程序性技能应通过将其净效应分解为收益与回归来评估,而不能只看总体提升。我们识别出技能应避免的三种回归模式,并发现可靠性更多取决于锚定与验证,而非程序性技能的选择。

回归税:分解技能为何有益也有害于LLM智能体:论文配图
图 1. 代理任务的三个阶段:基础(读取正确的输入)、方法(过程)和验证(检查输出)。现有的技能大多针对方法阶段。在我们的数据中,回归和残余故障集中在锚定和验证上。从左到右的管道图。 INPUT 按顺序提供三个阶段:基础、方法或推理、验证,然后是 OUTPUT。锚定和验证阶段被标记为服务不足,并被标记为锚定和验证回归的来源;中间的方法或推理阶段被标记为过度服务,并在技能有帮助的地方贴上标签。有一个传说区分了服务不足的舞台和服务过度的舞台。