论文
用canary工具诊断LLM Agent的工具选择推理
Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools
摘要
Agent评测通常能指出模型选错工具,却很少解释原因。作者提出canary tools(金丝雀探针工具),把专门诊断工具选择弱点的工具植入Agent的MCP工具集中。六类探针分别针对语义诱饵、参数陷阱、虚假能力、忽视前置条件、时间诱饵和粒度陷阱,将“选错工具”的单一结果拆成多维工具推理特征。作者评估八种模型,其中六种托管模型、两种8B开放权重模型,覆盖三个能力等级;在120个任务、三种探针密度与三个随机种子下运行8,640次,并增加2,880次隐蔽程度消融。任务成功由独立于供应商的评审模型判断,并用第二个独立评审模型验证,Cohen's kappa为0.75。结果显示:第一,模型能力越强,受探针影响的概率明显越低;各模型单任务canary易感率CSR相差约36倍,Claude Opus 4.8最低,Llama 3.1 8B最高。第二,仅凭能力等级不能预测安全性:最易受影响的托管模型处于中等等级,同一供应商中更便宜的模型也可能更安全。第三,探针类型具有能力分层差异:虚假能力探针最容易诱导前沿模型,其他类型对强模型大多不起作用,却能诱导小型开放模型。弱化暴露探针意图的短语后,前沿模型CSR基本不变,说明探针测量的是推理而非短语识别。易感性也与任务失败相关,Spearman rho为-0.34,而最稳健的模型没有因探针压力而显著退化。作者公开框架、探针Schema、任务和日志。
