论文

看不是选:LLM智能体工具选择失败的注意-分段解释

Looking Is Not Picking: An Attention-Segment Account of Tool-Selection Failures in LLM Agents

模型评测模型行为与机制分析

摘要

LLM智能体会错调工具——自然的猜测是模型在拥挤的工具架中没看到正确工具。我们通过一个被同期工作搁置的透镜——模型对带标签工具定义分段的注意——展示相反结论。在真实BFCL失败上——按逐候选注意argmax——模型80%的时间最注意正确工具(对照21%概率)——而黄金工具只是注意力不足分段的情形仅10%:它看着正确的工具仍选错。这直接反驳直觉的"拥挤工具架/迷失中间"解释:失败在决策读出端——不在工具架端——我们以三种方式钉死它。(1) 输入vs读出:修提示(重排或复制黄金工具)只恢复≤23%失败——而读出侧干预恢复59-91%。(2) 表示不变性:两种不同表示的黄金指向干预——加性注意力logit偏置与残差流转向向量——恢复大体相同的失败(合并逐任务Jaccard 0.865)——瓶颈被定位于读出、与戳哪个表示无关。(3) 免训练免黄金选择器:逐分段注意在BFCL上关闭大部分免黄金-对神谕缺口(合并函数名选择+11.9分,神谕余量+17.9分)——在Seal-Tools上+14.9分——全部模型为正(精确McNemar p≤8e-4)。范围有差异:因果注意偏置的剂量响应在10个遵循掩码的模型(3-32B)上双向单调——完整0.5-32B区间仅承载相关诊断;可部署选择器在5个单轮模型上评估——尚未迁移到多轮循环。