论文
回滚世界,保留反思:回滚引发的长期 LLM 代理人的反思
Rollback the World, Keep the Reflection: Rollback-Induced Reflection for Long-Horizon LLM Agents
摘要
大型语言模型 (LLM) 代理越来越多地通过多步骤环境交互来处理长期任务,但单个错误操作可能会改变后续状态和观察结果,导致错误随着时间的推移而复合。现有的方法要么在不修复改变的环境状态的情况下纠正上下文,要么在丢弃有用经验的同时恢复早期状态,这使得很难消除故障条件并避免重复过去的错误。我们认为,可靠的恢复应该被视为回滚边界控制问题,共同决定何时干预、在哪里恢复以及哪些信息应该在恢复后幸存。基于这一观点,我们提出了回滚诱导反射(RIR),这是一种统一的恢复框架,可将执行恢复到选定的先前状态,同时将从废弃轨迹中提取的可重用知识用于指导后续决策。我们通过回滚深度和保留内存的统一运算符进一步表征恢复,提供状态恢复和知识保留的一般视图。三个长期基准测试的实验表明,RIR 持续提高了多个 LLM 主干的任务性能,结构化反射内存保留了有用的经验,选择性回滚可实现高效恢复。