论文

The Amazing Agent Race:强工具使用者,弱导航者

The Amazing Agent Race: Strong Tool Users, Weak Navigators

智能体系统Agent任务评测

摘要

现有的LLM智能体工具使用基准绝大多数是线性的:我们对六个基准的分析显示,55%至100%的实例只是2到5步的简单链。我们提出The Amazing Agent Race(AAR),一个以带分叉-合并工具链的有向无环图(DAG)谜题(或称leg)为特色的基准。我们发布1,400个实例,涵盖两种变体:顺序型(800个leg)和组合型(600个DAG leg)。智能体必须在Wikipedia中导航、执行多步工具链,并将结果聚合为可验证的答案。各leg由Wikipedia种子程序化生成,覆盖四个难度级别,并经过实时API验证。三个互补指标(终点线准确率、进站访问率、路障完成率)分别诊断导航、工具使用和算术方面的失败。在1,400个leg上评估三个智能体框架,最好的也仅达到37.2%的准确率。导航错误占主导(占试验的27%至52%),而工具使用错误保持在17%以下,且智能体架构与模型规模同样重要(Claude Code以少6倍的token达到37%,与Codex CLI持平)。AAR的组合结构揭示出,智能体的失败不在于调用工具,而在于导航到正确的页面——这一盲点在线性基准中不可见。项目页面见:https://minnesotanlp.github.io/the-amazing-agent-race

The Amazing Agent Race:强工具使用者,弱导航者:论文配图
图2:呈现给智能体的线索信封(一赛段)示例,作为该基准中智能体导航与推理的任务输入。