论文
内部表征作为Agent工具选择幻觉的指示器
Internal Representations as Indicators of Hallucinations in Agent Tool Selection
摘要
大语言模型(LLM)在工具调用与工具使用方面展现出出色能力,但存在幻觉问题:选择错误的工具、提供畸形参数,并表现出“工具绕过”(tool bypass)行为,即以执行模拟和生成输出来代替调用专用工具或外部系统。这会削弱基于 LLM 的 Agent 在生产系统中的可靠性,因为它导致结果不一致,并绕过安全与审计控制。Agent 工具选择中的此类幻觉需要尽早检测和错误处理。与需要多次前向传播或外部验证的现有幻觉检测方法不同,我们提出了一个计算高效的框架:利用 LLM 在用于生成的那次前向传播中的内部表征,实时检测工具调用幻觉。我们在跨多个领域的推理任务上评估该方法,展示了强检测性能(准确率最高达 86.4%),同时保持实时推理能力且计算开销极小;该方法尤其擅长检测参数级幻觉和不当工具选择,这对可靠的 Agent 部署至关重要。
