论文
呼叫或不呼叫:诊断 LLM 代理中的内在过度呼叫偏差
To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents
摘要
LLM 代理表现出过度调用、调用工具的一致倾向,即使在不需要工具的情况下也是如此。在 When2Call 基准测试中,三个系列的 6 个模型显示出较高的呼叫准确率,但无呼叫准确率却低得多,总体准确率在 55%-70% 范围内。我们将其追溯到内在偏差假设(IBH):呼叫/不呼叫决策映射带有与激活无关的呼叫偏移,因此即使在激活奇偶校验时,模型也有利于呼叫。使用稀疏自动编码器(SAE),我们恢复了 call/no_call 决策的行为对齐特征库,将它们减少到带符号的激活边际,并直接估计偏移量。在所有六个模型中,仅当 no_call 激活超过 call 激活时,模型才是决策中立的,与 IBH 一致。然后,我们使用自适应裕度校准转向 (AMCS) 因果测试 IBH,这是一种沿着 SAE 解码器方向的封闭形式反偏置偏移。取消诊断的偏移可以减轻过度呼叫并提高整体准确性,而呼叫准确性的下降可以忽略不计。我们的工作将过度召唤从经验现象重塑为易于因果修正的机械对象。代码可在 https://github.com/SKURA502/agent-sae/ 获取。