论文

以封闭世界解析防御大模型智能体的工具幻觉

Closed-World Resolution Against Tool Hallucination in LLM Agents

模型评测智能体系统Agent Harness智能体互操作协议安全与风险评测MCP

摘要

工具增强的大语言模型智能体存在一种工具选择或工具安全方法均未解决的失效:调用不存在的工具,或传入任何模式都未声明的参数。现有防御要么选择正确工具,要么约束智能体使用真实工具时可做的操作,即门控;二者都预设生成的调用首先指向一个真实工具。我们说明这是一处结构性盲区:按照定义,幻觉调用不是任何门控作出的决策,因此没有门控能够拒绝它。本文主要是一项测量与基准研究。我们给出工具幻觉的五类分类体系H1—H5,并以Resolution Rung作为参考:它是无需训练的封闭世界解析器,由注册表成员检查与签名检查组成,重点在于它必须放置的位置,而非所做的计算。我们证明幻觉防御必须先于任何因果门控,并刻画一种不可消除的残余情况:借用参数在模式层面与有效调用不可区分。我们在两种调用界面下测量十个托管模型,发现322次真实幻觉;虚构工具调用集中在不受约束的原始JSON界面,次数为34对3,而且模型规模没有帮助,一个675B模型与一个7—8B模型表现相当。随后我们扩展至模型上下文协议MCP:将多个服务器合并到单一命名空间,会产生单一注册表无法表达的幻觉界面,我们另以M1—M5分类。在实际MCP界面上测得154次幻觉,包括在单注册表界面没有出现问题的前沿模型,因为冲突与遮蔽是合并操作的结构性问题。我们发布带版本的Hallucinated-Tools Benchmark(HTB),使不同提交的解析器能够比较。

以封闭世界解析防御大模型智能体的工具幻觉:论文配图
图1:防御栈。解析阶层(第0阶)在任何门控运行前,拒绝H1—H3及H5中可由模式检测的部分,单独使用也有效。可选因果门控拒绝前沿之外的真实工具H4,可选契约验证器拒绝损坏契约。剩余H5在模式层有效,会进入工具选择方法所处理的工具混淆问题。