论文
工具过度使用错觉:LLM为何偏好外部工具而非内部知识?
The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?
摘要
为LLM配备外部工具有效弥补了内部推理的局限。然而,这引入了一个关键但未被充分探索的现象:工具过度使用,即推理过程中不必要的工具调用。本文首先揭示这一现象在多样LLM中普遍存在。随后我们通过两个关键视角实验阐明其底层机制:(1)首先,通过分析不同内部知识可得性区域的工具使用行为,我们识别出知识认知错觉:模型误判内部知识边界,无法准确感知其实际知识可得性。为缓解这一点,我们提出基于直接偏好优化的知识感知认知边界对齐策略,将工具使用减少82.8%,同时带来准确率提升。(2)其次,我们通过可视化工具增强的训练过程,建立奖励结构与工具使用行为之间的因果联系。它揭示,仅结果奖励会因只奖励最终正确性、不问工具效率而无意中鼓励工具过度使用。为验证这一点,我们在训练中平衡奖励信号而非依赖仅结果奖励,在不牺牲准确率的情况下将不必要的工具调用削减66.7%(7B)和60.7%(32B)。最后,我们为这两个视角下的工具过度使用提供理论论证。
