论文

将规划与 LLM 代理中的情景记忆耦合以解决软件问题

Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution

智能体系统Agent 架构与控制循环

摘要

使用 大语言模型 (LLM) 代理解决实际软件问题是一个漫长的修复过程,通常需要数十到数百个步骤,涵盖探索、假设、实施和验证。成功取决于基础模型的局部推理以及智能体维护不断发展的计划并记住跨阶段观察结果的能力。现有的存储库级代理通常会孤立地加强规划或记忆,从而使长轨迹容易受到陈旧证据、重复失败编辑以及从代理自己的声明(而不是执行证据)推断出的验证的影响。我们推出了 PMCoder,一种问题解决代理,它将分层阶段规划器与情景记忆结合起来。这种耦合是双向的:当前计划阶段决定内存检索,而内存导出的轨迹统计则通知卡住检测和重新计划。如果可用,问题重现判决会根据执行证据中的地面验证进度而不是自我报告的完成情况。在 SWE-bench Verified 上,PMCoder 比Harness匹配的基线平均多解决 25 美元的案例 ($+5.0$pp),即使在再现门从未触发的情况下,收益也持续存在。进一步的 Verified-500 评估显示 Claude Haiku 4.5、DeepSeek-V4-Flash 和 OpenHands 移植具有相同的积极方向,至少有 14 美元的额外解决案例 ($+2.8$pp)。另外,对 TerminalWorld 官方样本的评估表明,该计划内存基板的传输超出了问题报告。消融和轨迹分析显示了收益的来源:耦合规划和内存优于单独的任何一个组件,并减少了重复的失败操作、空补丁退出和上下文窗口耗尽。