论文

LLM智能体技能的反事实轨迹审计

Counterfactual Trace Auditing of LLM Agent Skills

模型评测智能体系统Agent Skills评测方法与指标

摘要

大语言模型智能体正日益被各种智能体技能所增强。目前针对技能的评估方法仍然有限。大多数已部署的基准只报告技能挂载前后的通过率,把技能当作对智能体行为的黑箱式改变。我们提出反事实轨迹审计(CTA),一个度量技能如何改变智能体行为的框架。CTA将同一任务下带技能的智能体轨迹与不带技能的对照轨迹配对,把两条轨迹切分为面向目标的阶段,对齐这些阶段,并输出结构化的技能影响模式(SIP)标注。这些标注描述技能的行为效应,而不仅是其任务结果。我们在SWE-Skills-Bench上用Claude对49个软件工程任务实例化了CTA。由此得到的审计揭示出明显的评估鸿沟。通过率平均仅变化+0.3个百分点,表明总体影响很小。然而CTA在同样的配对轨迹中识别出522个SIP实例,表明即便通过率几乎不变,技能也实质性重塑了智能体行为。审计还区分出多种通过率无法察觉的复现性效应,包括字面模板复制、偏离任务的产物创建、过度规划以及任务恢复。研究得出三点发现。其一,高基线任务包含了大部分观察到的技能效应,但其通过率已经饱和,因此无法反映这些效应。其二,基线表现中等的任务显示出最多的可挽回收益,但往往伴随显著更高的token成本。其三,主导SIP类型可以按基线分档识别:表面锚定在天花板任务上最常见,边界用例提示在中档和低档任务上最常见。这些规律把非正式的失败模式观察转化为可复现的行为度量。

LLM智能体技能的反事实轨迹审计:论文配图
图 1:反事实追踪审计 (CTA)。对于每项任务,CTA 都会比较使用和不使用附加技能生成的一对智能体轨迹。该管道将​​原始日志解析为类型化事件,使用确定性有限状态机将每个跟踪分段为目标导向的阶段,在阶段和意图级别对齐两个跟踪,并提取本地化行为差异的分歧记录。然后,将每个差异映射到一个或多个技能影响模式 (SIP),从而对技能如何改变座席行为(超出总通过率)进行结构化审核。