论文
ScrambleToolBench:即使代理自己的地图指向下一步,他们也会进行详尽的搜索
ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step
摘要
为了在开放世界环境中稳健运行,即使在没有文档的情况下,自主代理也应该能够仅通过交互来推断不熟悉系统的行为。然而,现有的工具使用基准暴露了静态环境中的语义工具模式,允许代理依赖先验知识而不是自主发现。为了解决这个限制,我们引入了 ScrambleToolBench,这是一个交互式终端基准测试,旨在隔离行为推理。通过消除语义线索并强制执行连续的任务课程,该基准要求代理完全通过试错交互来发现隐藏的工具行为。该基准进一步引入了动态挑战,包括映射漂移、随机动作失败和时间执行窗口,以评估代理是否可以随着环境变化而修改和调整其假设。我们对最先进的语言模型的评估表明,成功的初始发现并不能转化为强大的适应。当面临诸如地图漂移之类的结构变化时,智能体无法使用诸如循环追踪之类的演绎策略,而是表现出信念惯性或退回到穷举搜索。增加测试时推理只会放大这种昂贵的强力搜索,而不是实现演绎恢复。虽然为智能体配备持久记忆可以减少复合错误,但它们仍然无法有效地推断结构变化,这凸显了当前智能体推理中的差距。