论文

用canary工具诊断LLM Agent的工具选择推理

Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools

智能体系统智能体互操作协议Agent任务评测MCP

摘要

Agent评测通常能指出模型选错工具,却很少解释原因。作者提出canary tools(金丝雀探针工具),把专门诊断工具选择弱点的工具植入Agent的MCP工具集中。六类探针分别针对语义诱饵、参数陷阱、虚假能力、忽视前置条件、时间诱饵和粒度陷阱,将“选错工具”的单一结果拆成多维工具推理特征。作者评估八种模型,其中六种托管模型、两种8B开放权重模型,覆盖三个能力等级;在120个任务、三种探针密度与三个随机种子下运行8,640次,并增加2,880次隐蔽程度消融。任务成功由独立于供应商的评审模型判断,并用第二个独立评审模型验证,Cohen's kappa为0.75。结果显示:第一,模型能力越强,受探针影响的概率明显越低;各模型单任务canary易感率CSR相差约36倍,Claude Opus 4.8最低,Llama 3.1 8B最高。第二,仅凭能力等级不能预测安全性:最易受影响的托管模型处于中等等级,同一供应商中更便宜的模型也可能更安全。第三,探针类型具有能力分层差异:虚假能力探针最容易诱导前沿模型,其他类型对强模型大多不起作用,却能诱导小型开放模型。弱化暴露探针意图的短语后,前沿模型CSR基本不变,说明探针测量的是推理而非短语识别。易感性也与任务失败相关,Spearman rho为-0.34,而最稳健的模型没有因探针压力而显著退化。作者公开框架、探针Schema、任务和日志。

用canary工具诊断LLM Agent的工具选择推理:论文配图
图 2:每个模型的每个任务金丝雀易感率(声明的条件;越低越好)。条形按提供商组排序,而不是按功能层排序。 Tier 并不对模型进行排序:最差的是中层模型,而中层模型击败了它的前沿模型。表 1 中带有置信区间的完整数字。