论文

学习检索:文本到 SQL 代理的双级长期记忆

Learning to Retrieve: Dual-Level Long-Term Memory for Text-to-SQL Agents

上下文与知识记忆Agent记忆

摘要

交互式文本到 SQL 代理通过涉及模式探索、查询执行、反馈解释和决策修订的多轮交互来解决数据库任务。长期记忆可以帮助智能体重用过去的经验,但现有的检索方法仍然有限。静态方法依赖于固定的相似性启发法,不会优化下游效用,而动态方法通常从稀疏的最终结果中学习并在单个决策范围内检索记忆。当内存有用性在交互阶段发生变化时,这是不够的,因为用于初始规划的内存可能与本地、状态条件执行所需的内存不同。我们提出了 MERIT,一种动态多水平记忆检索框架。 MERIT 维护用于全球战略指导的情节级记忆和用于本地决策支持的回合级记忆。这两个级别都使用通过强化学习优化的学习检索策略。为了在中间监督有限的情况下训练轮次检索,MERIT 使用轻量级过程奖励模型为本地内存选择提供密集的代理奖励。 BIRD-Interact 上的实验表明,MERIT 在成功率方面优于无记忆、静态检索和动态检索基线,同时减少了平均交互次数。 Spider2-Snow 上的传输结果进一步显示出积极的跨基准传输,无需针对特定基准进行调整。这些结果表明,多水平检索提高了交互式文本到 SQL 代理中的经验重用。