论文

LLM 不是优秀的战略家,但记忆增强代理可以增强推理能力

LLMs Are Not Good Strategists, Yet Memory-Enhanced Agency Boosts Reasoning

上下文与知识记忆Agent记忆

摘要

长期环境中的 大语言模型 (LLM) 中的策略推理通常受到不一致的子目标的限制。在这些设置中,有限的注意力资源阻止模型在数千个步骤中保持策略一致性。这种限制会导致战略漂移,局部决策无法维持推理的连贯轨迹。为了解决这个问题,我们引入了 EpicStar,这是一个框架,使代理能够将学习记忆作为解决长期推理的策略。具体来说,该智能体会维护一系列过去成功的事件作为启发,并使用工作记忆来跟踪短期环境变化。在推理过程中,动态门控机制决定是直接执行检索到的动作,还是通过检索到的情节和当前工作记忆的上下文融合来执行新的推理。我们以《星际争霸 II》为测试平台,针对不同的对手风格对 EpicStar 进行了评估。它显着优于基线方法,在消耗较少数量级的词元的同时实现更高的胜率,并且在不同难度级别和对手策略中始终保持这一优势。我们的研究结果提供了令人信服的证据,证明结构化跨情节记忆对于使 LLM 智能体能够在动态、自主的环境中执行稳健、长期的战略执行至关重要。