论文
模型自适应的工具必要性揭示LLM工具使用中的知行差距
Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use
摘要
大语言模型(LLM)越来越多地充当自主智能体,必须决定何时直接回答、何时调用外部工具。以往研究自适应工具使用的工作大多将工具必要性视为模型无关的属性,由人工或LLM裁判标注,且主要覆盖答案显而易见的情况(例如获取天气还是改写文本)。然而,由于不同模型能力边界的分歧,现实中的工具必要性更加微妙:强模型可以独立解决的问题,对较弱的模型可能仍需要工具。在本工作中,我们引入了一种基于各模型实际表现的模型自适应工具必要性定义。依照该定义,我们在算术与事实问答数据集上将必要性与四个模型观察到的工具调用行为进行比较,分别发现26.5-54.0%与30.8-41.8%的显著不匹配。为诊断这一失败,我们将工具使用分解为两个阶段:反映模型是否认为需要工具的内部认知阶段,以及决定模型是否实际做出工具调用动作的执行阶段。通过探测LLM隐藏状态,我们发现两种信号通常都线性可解码,但在驱动下一token动作的深层、末token区域中,二者的探测方向几乎正交。通过追踪样本在两阶段过程中的轨迹,我们进一步发现大部分不匹配集中在从认知到动作的转换环节,而非认知本身。这些结果揭示了LLM工具使用中的知行差距:提升工具使用可靠性不仅需要更好地识别何时需要工具,还需要更好地将这种识别转化为行动。
