论文

Agent过度信任工具:衡量对不可靠工具的依赖

Agents Trust Tools Too Much: Measuring Reliance on Unreliable Tools

模型评测鲁棒性、公平性与可信度评测

摘要

现有对使用工具的智能体的评估主要衡量智能体是否能够成功地使用工具完成不同的任务。这些评估通常假设工具返回可靠的信息。然而,现实系统中的工具返回可能看似合理,但却不正确。我们通过使用三种工具(网络搜索、LLM 子智能体委托和代码执行)评估 14 个 LLM,研究智能体如何响应不可靠的工具返回。对于每个工具,我们都会破坏其返回结果并衡量智能体是否在最终答案中采用损坏的内容。智能体在所有三种设置中都表现出高度的过度信任:每种工具的平均采用率超过三分之一,网络搜索的平均采用率达到 68.0%。对推理轨迹的分析揭示了一种特别令人担忧的故障模式:智能体通常会识别冲突,甚至在内部恢复正确的答案,但仅呈现损坏的答案而不警告用户。为了减轻智能体对工具返回的过度信任,我们在三个层面进行干预:用户的提示、工具提供商的元数据以及智能体构建者的后期培训。尽管某些干预措施有助于特定模型或工具,但没有一种干预措施能够持续缓解工具之间的过度信任。这些发现将对不可靠工具的过度信任视为一种严重且持续的故障模式,从而激发评估和干预措施,使智能体能够验证工具输出并透明地传达未解决的冲突。