论文

对齐进展与可行性:面向长程LLM智能体的神经符号双记忆框架

Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents

上下文与知识记忆Agent记忆

摘要

大语言模型(LLM)在具身操作与网页交互等长程决策任务中展现出强大潜力。然而,智能体在复杂环境中常常陷入无休止的试错循环,或偏离主要目标。我们将这些失败归因于两类根本性错误:全局的进展漂移(Progress Drift)与局部的可行性违背(Feasibility Violation)。现有方法通常试图用单一范式同时解决这两个问题。然而,这两类挑战在根本上是不同的:前者依赖模糊的语义规划,后者则需要严格的逻辑约束与状态验证。这种单一范式的固有局限使现有模型在处理长程任务时面临根本性挑战。受此洞见启发,我们提出神经符号双记忆框架,将语义进展引导与逻辑可行性验证显式解耦。具体而言,在推理阶段,该框架同步调用两种记忆机制:一方面,基于神经网络的进展记忆(Progress Memory)从成功轨迹中提取语义蓝图,引导全局任务推进;另一方面,基于符号逻辑的可行性记忆(Feasibility Memory)利用由失败转移合成的可执行Python验证函数执行严格的逻辑校验。实验表明,该方法在ALFWorld、WebShop和TextCraft上显著优于现有竞争基线,同时大幅降低了无效动作率与平均轨迹长度。

对齐进展与可行性:面向长程LLM智能体的神经符号双记忆框架:论文配图
图 1:我们的神经符号双重记忆框架概述。所提出的系统根据两个目标的不同推理需求,明确地将局部可行性对齐与全局进度对齐分开。顶部(离线阶段):失败的交互被编译成可执行的符号验证器规则,以构建符号可行性记忆,而成功的轨迹被提炼成阶段锚定的程序蓝图,以形成神经进度记忆。底部(推理阶段):在推理时,进度内存提供阶段感知指导,以提出进度一致的操作,而可行性内存在执行前执行符号可行性验证和迭代细化。