论文

LLM 代理已经知道何时调用工具——即使没有推理

LLM Agents Already Know When to Call Tools -- Even Without Reasoning

智能体系统Agent 工具调用

摘要

工具增强的 LLM 代理倾向于不加区别地调用工具,即使模型可以直接回答。每个不必要的调用都会浪费 API 费用和延迟,但现有的基准测试没有系统地研究何时实际需要工具调用。我们提出了 When2Tool,这是一个包含 18 个环境(15 个单跳、3 个多跳)的基准,涵盖工具必要性的三类——计算规模、知识边界和执行可靠性——每种环境都具有受控的难度级别,在需要工具和不需要工具的任务之间创建清晰的决策边界。我们评估 无需训练 基线的两个系列:仅提示(改变提示以阻止不必要的调用)和先推理再行动(要求模型在行动之前推理工具的必要性)。两者都提供有限的控制:仅提示会抑制必要的调用和不必要的调用,而“先推理后行动”仍然会在困难任务中产生不成比例的准确性成本。为了理解为什么这些基线失败,我们探究了模型的隐藏状态,发现工具必要性可以从六个模型的 AUROC 0.89--0.96 的预生成表示中线性解码,大大超出了模型自身的语言推理。这表明模型已经知道何时需要工具,但在生成过程中无法根据这些知识采取行动。基于这一发现,我们提出了 Probe&Prefill,它使用轻量级线性探针来读取隐藏状态信号,并用引导语句预填充模型的响应。在所有测试的模型中,Probe&Prefill 减少了 48% 的工具调用,仅损失了 1.7% 的精度,而同等精度的最佳基线仅减少了 6% 的工具调用,或者实现了类似的工具调用减少,但精度损失高出 5 倍。我们的代码位于 https://github.com/Trustworthy-ML-Lab/when2tool