论文

AgentEscapeBench:评测LLM智能体的域外工具依据对齐推理

AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents

智能体系统Agent任务评测长程任务评测

摘要

随着基于 LLM 的代理越来越依赖外部工具,评估他们在熟悉的工作流程和短程交互之外维持基于工具的推理的能力非常重要。我们引入了 AgentEscapeBench,这是一个逃生室风格的基准测试,用于测试代理是否可以在明确的远程依赖约束下推断、执行和修改新颖的工具使用程序。每个任务都定义了工具和项目的有向非循环依赖图,要求代理调用真实的外部函数,跟踪增量显示的隐藏状态,传播中间结果,并提交确定性可验证的最终答案。 AgentEscapeBench 包括跨五个难度级别的 270 个实例,并支持全自动评估。对 16 个 LLM 代理和人类参与者进行的实验表明,随着依赖深度的增加,性能急剧下降:人类从难度 5 的 98.3% 成功率下降到难度 25 的 80.0%,而最佳模型从 90.0% 下降到 60.0%。轨迹分析将模型失败主要归因于远程状态跟踪、线索坚持和中间结果传播的故障。这些发现表明,当前的代理通常可以处理本地工具的使用,但仍然难以应对深层的上下文依赖性。我们希望 AgentEscapeBench 能够作为诊断测试平台,用于测量当前智能体的能力,并为未来的训练工作提供信息,以实现更强大的通用推理、行动和适应。

AgentEscapeBench:评测LLM智能体的域外工具接地推理:论文配图
图 1:AgentEscapeBench 的概念图。特工被放置在一个主题逃生室中,里面充满了陌生的工具和隐藏的物品。它必须探索环境,调用具有从叙述线索派生的正确参数的工具,并通过多步骤依赖链传播中间输出以解锁最终出口。