论文

模型自适应的工具必要性揭示LLM工具使用中的知行差距

Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use

模型评测模型行为与机制分析

摘要

大语言模型(LLM)越来越多地充当自主智能体,必须决定何时直接回答、何时调用外部工具。以往研究自适应工具使用的工作大多将工具必要性视为模型无关的属性,由人工或LLM裁判标注,且主要覆盖答案显而易见的情况(例如获取天气还是改写文本)。然而,由于不同模型能力边界的分歧,现实中的工具必要性更加微妙:强模型可以独立解决的问题,对较弱的模型可能仍需要工具。在本工作中,我们引入了一种基于各模型实际表现的模型自适应工具必要性定义。依照该定义,我们在算术与事实问答数据集上将必要性与四个模型观察到的工具调用行为进行比较,分别发现26.5-54.0%与30.8-41.8%的显著不匹配。为诊断这一失败,我们将工具使用分解为两个阶段:反映模型是否认为需要工具的内部认知阶段,以及决定模型是否实际做出工具调用动作的执行阶段。通过探测LLM隐藏状态,我们发现两种信号通常都线性可解码,但在驱动下一token动作的深层、末token区域中,二者的探测方向几乎正交。通过追踪样本在两阶段过程中的轨迹,我们进一步发现大部分不匹配集中在从认知到动作的转换环节,而非认知本身。这些结果揭示了LLM工具使用中的知行差距:提升工具使用可靠性不仅需要更好地识别何时需要工具,还需要更好地将这种识别转化为行动。

模型自适应的工具必要性揭示LLM工具使用中的知行差距:论文配图
图 1:LLM 工具使用的两阶段认知执行模型概述。 (左)必要性:我们基于模型自身一致正确回答查询的经验能力,引入了工具必要性的模型自适应定义,与之前的模型无关方法形成鲜明对比。 (中)认知:通过探测模型的内部隐藏状态 hh,我们确定了一个线性认知方向 wcw_{c},它可以成功区分何时需要工具。 (右)操作:我们还训练探针 waw_{a} 来预测实际的工具调用执行。我们发现 wcw_{c} 和 waw_{a} 在后面的层中变得几乎正交,并且大多数必要性-行动不匹配源于执行阶段(将意识转化为行动)而不是内部认知阶段。