论文

内部表征作为Agent工具选择幻觉的指示器

Internal Representations as Indicators of Hallucinations in Agent Tool Selection

智能体系统Agent 动作执行与治理

摘要

大语言模型(LLM)在工具调用与工具使用方面展现出出色能力,但存在幻觉问题:选择错误的工具、提供畸形参数,并表现出“工具绕过”(tool bypass)行为,即以执行模拟和生成输出来代替调用专用工具或外部系统。这会削弱基于 LLM 的 Agent 在生产系统中的可靠性,因为它导致结果不一致,并绕过安全与审计控制。Agent 工具选择中的此类幻觉需要尽早检测和错误处理。与需要多次前向传播或外部验证的现有幻觉检测方法不同,我们提出了一个计算高效的框架:利用 LLM 在用于生成的那次前向传播中的内部表征,实时检测工具调用幻觉。我们在跨多个领域的推理任务上评估该方法,展示了强检测性能(准确率最高达 86.4%),同时保持实时推理能力且计算开销极小;该方法尤其擅长检测参数级幻觉和不当工具选择,这对可靠的 Agent 部署至关重要。

内部表征作为Agent工具选择幻觉的指示器 配图
图 1:用于工具调用幻觉检测的无监督、单遍训练流水线。给定用户查询与可用工具,LLM 生成包含工具调用的候选响应。我们对工具调用片段进行掩码以构造仅含上下文的提示,让模型再次预测该调用,并依据其与参考调用的一致性打标签(非幻觉 vs. 幻觉)。随后,我们在最后一层表示上训练一个轻量级分类器来区分正确调用与幻觉调用;在推理时,分类器实时为每个提议的调用打分,并据此对执行进行门控。