论文
回归税:分解技能为何有益也有害于LLM智能体
The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents
摘要
为 LLM 智能体添加程序性技能通常以任务成功率的平均提升来评估。然而,这一指标掩盖了一项重要代价:技能也可能使智能体变差。我们通过在两个办公自动化基准和三个模型框架栈上近 6,000 次运行中比较有技能与无技能的智能体,来度量这两个方面。这使我们能够区分两种结果。回归是指无技能时解决、添加技能后失败的任务。残余失败是指无论有无技能都失败的任务。我们发现回归的规模之大,以至于表现最好的技能之所以胜过其他技能,主要在于回归更少,而非收益更多。我们识别出回归的三种成因:(i) 技能描述渗透,即技能仅凭存在于上下文中就改变智能体的行为,即使它从未被调用;(ii) 锚定置换,即技能规定的流程覆盖了智能体解读其输入的方式;(iii) 验证置换,即该流程抑制了智能体原本会对自身输出执行的检查。对持续性失败的分析揭示了同样的底层模式。现有技能过度强调程序性指导——这是最不常导致失败的阶段——而对锚定与验证支持不足,后者才是剩余错误的主要来源。在修正评估工件并研究轨迹之后,我们发现许多回归和持续性失败可以通过更好的锚定与验证来挽回。程序性技能应通过将其净效应分解为收益与回归来评估,而不能只看总体提升。我们识别出技能应避免的三种回归模式,并发现可靠性更多取决于锚定与验证,而非程序性技能的选择。
