论文
AllocBench:测量 LLM 代理中的在线工具分配能力
AllocBench: Measuring Online Tool Allocation Capability in LLM Agents
摘要
创建可重用工具是一项投资:代理现在支付固定成本,以换取未来重用的潜力。因此,用户应该更喜欢创建少量高度可重用工具的代理,而不是许多一次性工具。我们引入了一个配对基准,测试 LLM 智能体是否在固定预算下在两种情况下表现出有意识的分配行为:基于抽象文本的公式和代码构建任务。我们发现我们测试的每个前沿模型——Claude Haiku、Claude Opus、GPT-5.4-mini 和 GPT-5.6 Sol——在抽象框架中表现接近最佳,但未能将这种能力转移到脚本编写中。通过进一步的实验,我们确定了每个模型的特定故障模式。值得注意的是,即使不评估脚本,前三个模型也会失败,而 GPT-5.6 Sol 在较弱的操作下保持选择性,并且仅在完全构建时崩溃。此外,针对抽象分配进行策略训练的开源 Qwen 模型在保留的词汇变化中推广了这种能力,但在脚本分配方面没有看到任何改进。总之,这些结果将在线工具分配确立为重要的能力边界,即使对于现代前沿模型也是如此。