论文
校准是瓶颈:多转刀具调用的动作级诊断
Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling
摘要
多轮工具调用是大语言模型(LLM)代理的核心评估场景。在公共工具调用基准上,开放权重模型现在在总体精度上接近甚至超过闭源前沿模型。然而,该指标对许多不同的多回合情况进行平均,并掩盖了它们之间的进度是否平衡。我们提出了一种面向动作类的诊断框架,它将多轮故障分解为两种正交模式:动作类错误校准和动作执行失败。该框架在四类动作空间(TOOL_CALL/ASK/REFUSE/CONFIRM)上运行,并引入了自我揭示的上限 Acc <= GAR(标准动作召回);这两种模式显示为边界违规(Acc > GAR,暴露状态分级机对错误校准的屏蔽)和大边界松弛(GAR >> Acc,在 TOOL_CALL 中本地化执行失败)。我们在跨多个多轮基准的工具调用模型面板上对其进行了验证。在我们的面板中,诊断显示动作级校准错误是州平地机无法发现的重大故障模式。这种差距扩大了受过严格工具训练的家庭的地位,我们的诊断将其与具有适合情境的行动选择的家庭区分开来。校准可以通过仅上下文扰动来重塑,但重塑是异质的:单个扰动会在不同的族中向相反的方向移动精度(在相同场景下高达 +11.5 与 -21.0 pp),其效果进一步取决于扰动机制。我们认为,多轮工具调用评估应该通过动作类诊断来补充总体准确性,这些诊断揭示了模型在每个场景中实际执行的操作。