论文
ToolMenuBench:面向可靠高效智能体的工具菜单过滤策略基准
ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents
摘要
工具增强的大型语言模型代理越来越多地在大型工具库上运行,但现有的评估通常侧重于模型是否可以正确调用工具,而不是可见的工具菜单如何塑造可靠性、效率和安全相关的风险暴露。我们引入了 ToolMenuBench,这是一个评估多步骤 LLM 代理中工具菜单构建的基准。 ToolMenuBench 改变工具菜单大小、干扰项类型、状态相关的任务结构和风险暴露,并报告过滤器级别和下游代理指标,包括可见工具计数、有风险的工具暴露、任务成功、错误工具调用、过早操作和词元使用。在对七个模型后端、三种工具菜单大小、六种过滤方法和七种评估设置的受控评估中,CMTF 将任务成功率从所有工具暴露下的 32.1% 提高到 85.7%,同时将平均词元使用率降低了大约 98%。因果最小工具过滤实现了最强的整体权衡,相对于未过滤的暴露、词法过滤、状态感知过滤和更广泛的因果路径基线,减少了可见工具、错误工具调用、不成熟的操作和危险工具暴露。 ToolMenuBench 提供了一个可重用的评估框架,用于研究代理界面问题:哪些工具应该可见,何时应该可见,以及在什么成本或风险约束下。
