论文

AgentRewind:面向长程LLM智能体的可恢复执行

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents

智能体系统Agent HarnessAgent Runtime

摘要

许多真实世界任务要求LLM智能体在很长的执行跨度上与环境交互。执行早期发生的错误可能在智能体上下文和环境状态中同时传播,其影响可能难以通过后续动作逆转。现有方法主要通过计划精炼和安全检查来减少此类错误,但在错误发生后提供的支持很少。为了在长程执行期间实现恢复,我们提出AgentRewind,一个运行时恢复框架,它记录智能体上下文与受控环境的对齐检查点,允许智能体回到较早状态并携带此前尝试的信息恢复执行。我们还构建了MettleBench,一个用于评估任务完成度与部分进展的基准,面向包含一系列相关需求的长程工程任务。跨任务、多模型、多种执行策略和智能体框架的实验表明,与对比基线相比,AgentRewind提升了任务成功率和平均清单进度。

AgentRewind:面向长程LLM智能体的可恢复执行:论文配图
图1:AgentRewind 概览。(a) AgentRewind 作为运行时层运行于智能体与受控外部环境之间。上下文记录器与环境状态记录器创建对齐的检查点 d_t=(c_t, s_t)。回退时,智能体选择一个目标检查点,随后回退执行器恢复相应的上下文与环境状态并注入回退记忆。(b) 一个可恢复执行的示例。当智能体判定当前轨迹无法继续推进时,它会调用回退。轨迹返回到 d_k,保留至该检查点的前缀,并以新的后缀继续。