当工具决定时:LLM智能体盲目遵从图神经网络工具
When the Tool Decides: LLM Agents Defer Blindly to Graph Neural Network Tools, and Stronger Backbones Defer More
摘要
越来越多的工作为大型语言模型(LLM)代理配备图神经网络(GNN)作为可调用工具,假设代理对何时以及在多大程度上依赖这种工具进行判断。我们直接测试一下。我们将冻结的 GNN 暴露给 ReAct 风格的 LLM 代理作为显式工具和测量,对文本属性图(ogbn-arxiv,在 WikiCS 上复制)上的节点分类,无论代理使用该工具还是仅仅服从它。我们发现智能体不会进行判断:它的预测在 97.6-99.2% 的情况下(5 个种子)与原始 GNN 一致,从而崩溃成一个 GNN 鹦鹉,它批量采用该工具的输出并绕过自己的推理。全面的骨干能力(Qwen2.5 0.5B-7B),尊重不是弱模型工件:在能够调用该工具的模型中,一致性随着能力的增加而上升(从1.5B到7B从0.60到0.98)。至关重要的是,遵从成本并不会随着能力的增长和替代方案的出现而减少:针对可用操作的每节点预言机在 3B 时比鹦鹉击败 0.09-0.18,在 7B 时击败鹦鹉 0.12-0.22,在高同质性下大约翻倍,因为鹦鹉被固定在冻结的 GNN 上,而代理的替代方案则得到改善;在 7B 处,一个简单的邻居标签工具以高同质性(0.81 vs 0.71)超越了 GNN,但智能体仍然推迟。一个简单的选择性调用门可以恢复大约一半的高同质性差距(0.71 到 0.83),但不会产生净全局增益,并且保留的估计将标准测试时间功能上可实现的最佳门限制为最多三分之一的预言机空间:可靠的选择性调用看起来受到可用信息的限制,而不仅仅是路由器设计。我们的结果是一个警示性的衡量标准:对代理+工具系统的评估不能假设代理在工具之上添加判断,并且选择性调用必须在规模中设计,而不是预期从规模中出现。