论文

LongHorizo​​n-Harness:推进长视野智能体执行实际任务

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

智能体系统Agent HarnessAgent Runtime

摘要

大语言模型 (LLM) 智能体越来越多地承担长期任务,这些任务需要在许多相互依赖的步骤中进行持续推理、工具使用和修改。然而,现有的代理工具在不断增长的环境中维护任务执行、任务状态和完成评估,这使得状态难以跟踪,并允许错误的自我评估传播到以后的决策中。我们将长视野执行重新表述为任务状态管理问题,并提出了 LongHorizo​​n-Harness,它在执行之外显式地维护任务状态,并仅使用从环境中独立验证的事实来更新它。其管理-执行-审核(MEA)循环使用管理器来维护任务状态并确定下一个子任务,使用新上下文执行器来执行它,并使用只读审核器来在下一轮之前验证结果环境状态。轻量级 AgentAdapter 支持可互换模型和利用后端,而无需修改其本机代理循环。 LongHorizo​​n-Harness 将 Qwen~3.7-Plus 在 WeaveBench 上的性能从 51.8% 提高到 80.7%,在 Terminal-Bench~2.1 上从 69.7% 提高到 77.2%,在 OSWorld~2.0 上从 2.8% 提高到 8.3%。它还将 OSWorld2.0 子集上的 Claude Opus~4.7 从 20.0% 提高到 34.3%,展示了跨模型、工具和交互领域的一致增益。