论文

技能使用还是技能表演?评估技能增强语言智能体的推理后台

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

模型评测智能体系统Agent Skills评测方法与指标

摘要

可复用技能正在成为用任务程序扩展语言智能体的标准接口。然而,评估者通常从可见推理或智能体自身的归因来推断技能使用。这些信号显示的是智能体看起来在用什么,而不是技能是否改变了它的决策。我们追问:技能增强的智能体是否表现出“推理后台”(Reasoning Backroom),即声称的技能使用与经干预测得的影响之间的系统性落差。我们提出BACKTRACE评估框架:为每个技能条件下的答案配对一个匹配的无技能反事实,对技能的含义、措辞、身份、内容与分配进行干预,并只在答案提交之后才引出归因。我们将该框架实例化为BACKROOMBench,一个经过验证的测试床,涵盖受控逻辑与竞赛数学、多种技能条件、单智能体与多智能体设置以及多个模型家族。我们的评估揭示了一种普遍的来源失效(provenance failure)。跨模型与跨领域,声称的技能使用往往保持稳定,而因果依赖与带符号效用却在变化,同时产生“沉默吸收”与“表演性使用”。行为效应跟随程序性内容的可靠程度高于跟随所展示的技能身份,而声称的归因则对技能产物是否可得反应强烈。基于直接技能使用声明、文本提及、轨迹相似度和LLM裁判的观察式检测器,无法识别哪些决策真正依赖技能。在多智能体系统中,技能影响即使在其来源丢失之后仍可经由通信延续,而无技能团队仍会说出从未提供过的技能与来源。这些发现将“推理后台”确立为一个普遍的AI来源性问题,其审计必须依赖干预。

技能使用还是技能表演?评估技能增强语言智能体的推理后台:论文配图
图 1:跨逻辑证明深度的正确技能结果(每个深度 60 个实例)。