论文
工具调用的惨痛教训
The Bitter Lesson of Tool Calling
摘要
工具的使用将 LLM 转换为超出其训练数据范围的代理,对于支持代码的模型,编程工具调用通过用自然链接和并行的脚本替换严格的 JSON 调用来进一步扩展这一点。然而,尚未对实际任务条件下当前和先前模型代的既定基准对工具即代码进行系统评估。在这项工作中,我们根据经验比较了 BFCL v4 上 14 种语言模型的编程工具调用 (PTC) 与本机 JSON 工具调用。在编程工具调用范例中,工具被公开为模型通过代码调用的类型化 Python 存根,执行和结果在单个代理轮次中处理。在 BFCL v4 上的 14 个模型中,有 11 个模型的编程工具调用与本机 JSON 工具调用相匹配或超过了本机 JSON 工具调用,GPT-5.6 系列比 JSON 工具调用基线提高了 10.6%。此外,在并行扇出下,它在 14 个模型中的 13 个中匹配或优于基线,并且在基线平均下降 2.3% 的上下文衰减条件下保持稳定。我们的结果表明,编程工具调用是 JSON 工具调用的可行且强大的替代方案,具有跨版本的性能跟踪模型功能。