论文

长时程任务是海市蜃楼吗?诊断智能体系统在何处以及为何失效

The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break

智能体系统Agent任务评测

摘要

大语言模型(LLM)智能体在短时程与中时程任务上表现强劲,但在需要长链条且相互依赖的动作序列的长时程任务上常常失效。尽管智能体系统进展迅速,这类长时程失效仍缺乏清晰的刻画,阻碍了跨领域的原则性诊断与比较。为填补这一空白,我们提出HORIZON,一个用于系统性构造任务并分析基于LLM的智能体长时程失效行为的初步跨领域诊断基准。利用HORIZON,我们评估了来自多个模型家族(GPT-5变体与Claude模型)的最先进(SOTA)智能体,在四个代表性智能体领域收集了3100余条轨迹,以研究随时程变化的退化模式。我们进一步提出一条以轨迹为依据的LLM-as-a-Judge流水线,用于可扩展、可复现的故障归因,并通过轨迹上的人类标注加以验证,取得了强一致性(标注者间κ=0.61;人类与评判模型间κ=0.84)。我们的发现为系统化、跨领域分析智能体长时程失效迈出了初步的方法论一步,并为构建更可靠的长时程智能体提供了实践指导。我们已在 HORIZON Leaderboard(https://xwang2775.github.io/horizon-leaderboard/)发布项目网站,欢迎社区贡献。

长时程任务是海市蜃楼吗?诊断智能体系统在何处以及为何失效:论文配图
图 1:一般代理执行和故障传播的图示。给定指令 1,代理迭代一个标准循环:它观察环境 2 以获取观察结果 3,计划并选择一个操作 4,在内存支持的上下文 6 上绘制,执行该操作以更改环境,然后通过内存 6 更新其内部状态 5。故障可以起源于任何阶段并跨周期复合 7。七个图例框直接映射到第 3.2 节中的故障类别。