论文
LLM 滥用工具时的一些神经元揭示:稀疏检测和选择性引导以实现可靠的工具使用
A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use
摘要
Agentic LLM 表现出三种间接的工具使用失败:无效参数(有效性)、不必要的调用(过度调用)以及需要工具时省略调用(缺失)。我们发现,一小部分特定于故障的 MLP 神经元可以通过线性可分离的决策边界来区分此类故障。基于这一观察,我们引入了 PRISMS(支持监控和转向的探测表示),这是一个闭环框架,在稀疏检测和激活转向之间共享特定于故障的神经元基础。 PRISMS 选择贡献关键的 MLP 神经元,并在其激活上安装 L1 正则化检测器。在 Qwen3、Llama 和 Gemma 系列的六个模型中,在生成前提示边界处检测到过度调用和缺失,ROC-AUC 0.90-1.00,而从生成的工具调用跨度中检测有效性,ROC-AUC 0.86-0.90。这些结果是通过高度稀疏的读数实现的:仅丢失 1-2 个 MLP 神经元,过度调用 2-16 个神经元,以及大约 128 个有效神经元。这些稀疏检测器使用少 23-627 倍的特征来匹配或优于密集残差流基线。共享神经元基础还支持对工具调用行为的双向控制,抑制不必要的调用并引发省略的调用。因此,PRISMS 对预测的故障风险进行干预,以减轻无条件转向的附带影响。在所有六种模型中,PRISMS 将汇总过度调用率降低了 80%(从 0.131 到 0.026),同时将工具所需的准确度提高了 14.2 个百分点(从 0.689 到 0.831)。因此,PRISMS 提供了跨模型系列的轻量级故障检测和选择性干预。