论文
RPMS:通过规则增强记忆协同提升基于LLM的具身规划
RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergy
摘要
LLM智能体在封闭世界具身环境中经常失败,因为动作必须满足严格的前置条件——如位置、库存与容器状态——且失败反馈稀疏。我们识别出两种结构性耦合的失效模式:(P1)无效动作生成与(P2)状态漂移,二者在退化循环中相互放大。我们提出RPMS,一种冲突管理架构,通过结构化规则检索强制动作可行性,通过轻量信念状态控制记忆的适用性,并通过规则优先仲裁化解两个来源之间的冲突。在ALFWorld(134个未见任务)上,RPMS使用Llama 3.1 8B达到59.7%的单次尝试成功率(比基线高23.9个百分点),使用Claude Sonnet 4.5达到98.5%(高11.9个百分点);在8B模型的增益中,仅规则检索就贡献了+14.9个百分点(具有统计显著性),是主导因素。一个关键发现是情节记忆是有条件有用的:在不加接地的情况下使用时,它会损害某些任务类型的性能;但一旦经当前状态过滤并受显式动作规则约束,它就变成稳定的净收益。将RPMS适配到使用GPT-4的ScienceWorld,在所有消融条件下均取得一致增益(平均分54.0,而ReAct基线为44.9),提供了核心机制在结构不同环境中依然成立的迁移证据。
