论文

以行动为中心的图:桥接推理时扩展与情景记忆

Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs

上下文与知识记忆Agent记忆

摘要

推理时扩展(inference-time scaling)的最新进展显著释放了大语言模型(LLM)的复杂推理能力。然而对智能体而言,这些方法存在一个关键的低效问题:以无状态方式运行,并陷入冗余的搜索过程。现有记忆机制大多依赖LLM的推理能力,导致令人望而却步的计算成本。本文提出一个新框架GAMER(Graph-based Action-centric Memory with Episodic Reasoning,基于图的行动中心记忆与情景推理),弥合推理扩展与情景记忆之间的鸿沟。我们的方法将历史推理建模为动态的“行动中心图”(Action-Centric Graph)。通过把记忆机制与LLM解耦,我们的方法能够以少于记忆机制基线的记忆上下文节省token和费用。为了从图中有效提取知识,我们使用双流时序差分(Temporal Difference)学习机制,基于过往的成功与失败来估计行动节点的正值(建议)与负值(规避)。在推理阶段,这一习得的价值函数双向优化决策:正值提供行动建议,负值标示高风险行动。通过在图上执行高效搜索,我们的方法显著提升了推理扩展的效率。在多个基准上的实验表明,GAMER相比原始基线在成功率/进度率上分别取得20.81%/6.17%的优越表现。

以行动为中心的图:桥接推理时扩展与情景记忆:论文配图
图1:我们框架的整体流程,可以分为三个阶段,包括1.轨迹池收集,2.轨迹图构建,3.在线更新。在此管道中,选择前 3 个操作。