论文

Long-Horizon-Terminal-Bench:以密集奖励评分测试智能体长程终端任务极限

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

智能体系统Agent任务评测长程任务评测

摘要

AI智能体已能自主完成短的、良指定任务。但既有终端基准大多聚焦数分钟内完成、仅按最终结果评估的简单问题:忽略中间进展与部分解,产生稀疏奖励信号与不完整的智能体能力画像。我们提出Long-Horizon-Terminal-Bench:一个含46个长程任务、跨九个类别的终端基准——包括实验复现、软件工程、多模态分析、交互游戏与科学计算。每任务遵循Terminal-Bench式设置(参考解或仿真引擎),但进一步分解为细粒度可评分子任务:支持密集中间奖励与部分得分,使评估既捕捉是否达到最终目标、也捕捉在开放式工作流上走了多远。任务通常需要数百回合、数分钟至数小时执行,考验长程规划、长上下文管理与迭代调试而非一次性解题。我们评估15个前沿模型:智能体平均每任务消耗990万token、约231回合与85.3分钟执行——比既往终端基准更苛刻。最强受测模型在0.95部分奖励阈值下仅15.2% pass@1、1.0完美阈值下10.9%;全部模型均值分别为4.3%与1.7%。这些结果显示改进空间。我们进一步分析失败模式与错误规律,并发布该基准支持长程终端智能体的后续进展。

Long-Horizon-Terminal-Bench:以密集奖励评分测试智能体长程终端任务极限:论文配图
图1:密集奖励分级的长视野终端任务的总体结构。部分奖励显示模型完成任务的程度。