论文
LLM智能体技能的反事实轨迹审计
Counterfactual Trace Auditing of LLM Agent Skills
摘要
大语言模型智能体正日益被各种智能体技能所增强。目前针对技能的评估方法仍然有限。大多数已部署的基准只报告技能挂载前后的通过率,把技能当作对智能体行为的黑箱式改变。我们提出反事实轨迹审计(CTA),一个度量技能如何改变智能体行为的框架。CTA将同一任务下带技能的智能体轨迹与不带技能的对照轨迹配对,把两条轨迹切分为面向目标的阶段,对齐这些阶段,并输出结构化的技能影响模式(SIP)标注。这些标注描述技能的行为效应,而不仅是其任务结果。我们在SWE-Skills-Bench上用Claude对49个软件工程任务实例化了CTA。由此得到的审计揭示出明显的评估鸿沟。通过率平均仅变化+0.3个百分点,表明总体影响很小。然而CTA在同样的配对轨迹中识别出522个SIP实例,表明即便通过率几乎不变,技能也实质性重塑了智能体行为。审计还区分出多种通过率无法察觉的复现性效应,包括字面模板复制、偏离任务的产物创建、过度规划以及任务恢复。研究得出三点发现。其一,高基线任务包含了大部分观察到的技能效应,但其通过率已经饱和,因此无法反映这些效应。其二,基线表现中等的任务显示出最多的可挽回收益,但往往伴随显著更高的token成本。其三,主导SIP类型可以按基线分档识别:表面锚定在天花板任务上最常见,边界用例提示在中档和低档任务上最常见。这些规律把非正式的失败模式观察转化为可复现的行为度量。
