论文

诊断LLM工具使用中的知识缺口:面向新API获取的智能体基准

Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition

模型评测基准与评测资源

摘要

用于代码生成的大型语言模型通常需要使用其预训练数据中缺少的 API。这需要的不仅仅是回忆函数名称:模型必须协调签名、模块路径、输入输出契约、语义和可执行使用模式。现有的新颖 API 基准通常是静态的,依赖于粗略的通过/失败指标,或者使用可能无法反映真实库演变的合成 API。我们推出了NovelAPIBench,这是一个完全自动化的动态基准测试,对于任何基础模型和目标库,它都可以发现新颖的API,提取分解的知识包,生成可执行的编码任务,并将失败的样本分配给六个诊断类别。在大约 1.9K 个任务、四个基本模型和五个领域中,我们将通过检索注入的知识与通过参数适应内化的知识进行比较。我们发现知识组件是不可互换的:使用示例是最强的独立信号,而最佳的两组件设置将签名与机制或示例配对,具体取决于领域和主干。添加更多上下文,尤其是源代码,可能会因增加导入路径错误而受到损害。一旦外部知识被移除,参数适应也不会取代检索;相反,微调主要教会模型如何使用提供的捆绑包,并将这种能力转移到保留的库中。这些结果表明检索​​和调优发挥着互补作用:检索提供易变的 API 内容,而调优则改进程序集成。