论文

调用来自模型内部:研究 LLM 中基于探针的工具调用错误检测

The Calls are Coming from Inside the Model: Investigating Probe-based Detection of Tool-Calling Errors in LLMs

模型评测模型行为与机制分析

摘要

众所周知,大语言模型 (LLM) 的隐藏状态可以捕获与模型知识和行为相关的丰富信息,而这些信息很难仅通过输入和输出的检查来提取。随着基于 LLM 的系统越来越多地与外部世界交互,一个值得关注的领域是检测工具的不正确或不当使用。受此启发,我们研究了使用线性探针检测不正确工具调用的有效性,测量了 Berkeley 函数调用排行榜上评估的 18 个工具调用 LLM 的探针功效。总的来说,我们发现探测是捕获一系列不同工具调用错误的有效方法,包括使用具有错误值但类型正确的参数而产生的错误,这些错误可能不会被标准日志记录框架记录。成功的重要因素包括模型大小、探测层和模型 后训练 类型。我们还表明,探测器能够泛化到新类型的错误,这在现实世界的部署中至关重要。