论文
对齐进展与可行性:面向长程LLM智能体的神经符号双记忆框架
Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents
摘要
大语言模型(LLM)在具身操作与网页交互等长程决策任务中展现出强大潜力。然而,智能体在复杂环境中常常陷入无休止的试错循环,或偏离主要目标。我们将这些失败归因于两类根本性错误:全局的进展漂移(Progress Drift)与局部的可行性违背(Feasibility Violation)。现有方法通常试图用单一范式同时解决这两个问题。然而,这两类挑战在根本上是不同的:前者依赖模糊的语义规划,后者则需要严格的逻辑约束与状态验证。这种单一范式的固有局限使现有模型在处理长程任务时面临根本性挑战。受此洞见启发,我们提出神经符号双记忆框架,将语义进展引导与逻辑可行性验证显式解耦。具体而言,在推理阶段,该框架同步调用两种记忆机制:一方面,基于神经网络的进展记忆(Progress Memory)从成功轨迹中提取语义蓝图,引导全局任务推进;另一方面,基于符号逻辑的可行性记忆(Feasibility Memory)利用由失败转移合成的可执行Python验证函数执行严格的逻辑校验。实验表明,该方法在ALFWorld、WebShop和TextCraft上显著优于现有竞争基线,同时大幅降低了无效动作率与平均轨迹长度。
