论文

为 AI 代理提供自然语言工具的显着效果:一项验证 14 个模型的 NLT 性能的复制研究

The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models

模型评测模型能力评测

摘要

这项研究独立地复制和扩展了 Johnson 等人~(2025) 的自然语言工具 (NLT) 框架,该框架质疑 大语言模型 (LLM) 代理系统中结构化工具调用的使用。我们评估了 14 个模型和 8,560 次试验的 NLT,在原始模型集中添加了更新的前沿模型、推理模型和开放权重模型。结果证实了核心发现并增加了细节。 NLT 总体上将工具调用准确度提高了 14.9 个百分点(结构化为 62.3%,相对于结构化为 47.4%),并将关键错误减少了 93%(错误为 51 个,相对于 755 个错误)。增益取决于模型能力:没有本机工具调用的模型、推理模型和较小的模型大幅增益(+24.0pp 至 +43.1pp),而深度优化的前沿模型(GPT-5、Gemini 2.5 Pro)则显示出较小或相反的优势。这与最近对强化学习优化工具使用的分析相匹配(Martinez,2025)。 NLT 还将词元使用量减少了 25.2%。可靠性和效率优势在递归代理工作流程中得到了复合,其中代理跨子代理链接了许多工具调用:结构化故障触发重试、回退路由和协调开销,而 NLT 从源头避免了大部分成本。这项工作做出了三个贡献:(1)首次使用开源工具对 NLT 进行独立验证,(2)证据表明模型能力调节了 NLT 的优势(Chen 等人,2025 年;Zhang 等人,2025 年),以及(3)衡量 NLT 的可靠性优势(错误减少 93%),考虑到已知的结构化工具调用的脆弱性,这是其与部署最相关的属性。 NLT 是结构化工具调用的实用替代方案,特别是对于重视可靠性而非可解析性的生产系统。