论文
OneDayAgent:迈向自主代理的长期管理
OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents
摘要
LLM 代理越来越多地应用于跨越工作、学习和生活的开放式日常请求。这些任务是长期、跨环境和多模式的,迫使代理在使用异构工具和附件时跨多个步骤保留目标和约束。虽然之前的工作已经解决了诸如目标漂移、状态丢失和上下文溢出等单独的故障模式,但单个工具是否可以共同管理它们并在后端之间保持有效的研究较少。我们推出了 OneDayAgent,这是一种用于自主代理的长视野工具。 OneDayAgent 将开放式请求转变为托管执行流程,将任务分解为有界子任务,在上下文压力下维护执行内存,并验证和修复最终可交付成果。我们在 AgentIF-OneDay 上跨 104 项任务评估 OneDayAgent。凭借 GLM-5.2 后端,OneDayAgent 以 0.821 的总分创下了新的最先进水平。相同的Harness运行在来自三个模型系列的五个后端 LLM 上,这表明该Harness无需调整即可跨后端泛化,即使不同的模型在同一工作流下产生不同的执行风格也是如此。