论文
超越函数调用:工具环境不可靠性下的工具使用代理的基准测试
Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability
摘要
大语言模型 越来越多地部署为通过与外部工具环境交互来解决任务的代理。尽管最近的工具使用基准越来越多地涵盖复杂的任务设置,但它们仍然在很大程度上假设干净、稳定和值得信赖的工具环境,从而使工具环境的不可靠性没有得到充分的检查。我们引入了 ToolBench-X,这是一个评估可恢复可靠性风险下代理的基准。 ToolBench-X 包含跨不同领域的可执行多步骤任务以及顺序、并行和混合工作流程,每个工作流程都配有确定性工具和自动评估的规范最终答案。从干净的工具环境开始,ToolBench-X 注入了五种结构化危险类型:规范漂移、调用错误、执行失败、输出漂移和跨源冲突。至关重要的是,每个注入的实例仍然可以通过至少一个有效的恢复路径来解决,例如重试、回退、验证或交叉检查。实验揭示了巨大的可靠性差距:使用可靠工具表现良好的代理通常会在可恢复的危险下失败。进一步的分析表明,故障更多地是由有限的危险诊断和无效的恢复引起的,而不是由工具使用量或推理预算引起的。有针对性的恢复提示可以恢复许多失败的任务,而测试时间扩展产生的收益更为有限。这些结果表明,工具使用评估应该超越函数调用的准确性,转向在不可靠的工具环境下完成任务。代码和数据可在 https://github.com/Foreverskyyou/ToolBench-X 获取。