论文
工具就是全部所需吗?揭示LLM Agent中的工具使用税
Are Tools All We Need? Unveiling the Tool-Use Tax in LLM Agents
摘要
工具增强推理已成为基于LLM的agent的热门方向,并被普遍认为能提升推理能力与可靠性。然而,我们证明这一共识并不总是成立:在存在语义干扰项时,工具增强推理未必优于原生CoT。为解释这一性能差距,我们提出因子化干预框架(Factorized Intervention Framework),将提示格式化的成本、工具调用协议的开销与执行工具的实际收益分离开来。我们的分析揭示了一个关键权衡:在语义噪声下,工具带来的收益往往无法抵消“工具使用税”(tool-use tax),即工具调用协议本身引入的性能退化。为解决这一问题,我们提出G-STEP,一个轻量的推理时门控,用于缓解协议引入的错误。尽管这带来了部分恢复,但我们的发现表明,更实质的改进仍需强化模型内在的推理与工具交互能力。
