论文

Panini:借助结构化记忆在词元空间持续学习

Panini: Continual Learning in Token Space via Structured Memory

上下文与知识记忆Agent记忆

摘要

语言模型越来越多地被用于对其未训练过的内容进行推理,如新文档、不断演进的知识和用户特定数据。常见做法是检索增强生成(RAG):将文档原文分块外存,推理时只检索相关子集供 LLM 推理。然而这导致测试时算力使用低效(LLM 反复对同一文档推理);此外,分块检索可能注入无关上下文,增加无依据的生成。我们提出类人的非参数持续学习框架:基座模型保持固定,学习通过把每次新经验整合进一个持续积累和巩固的外部语义记忆状态来实现。我们提出 Panini,它把文档表示为生成语义工作区(GSW)——一个实体与事件感知的问答(QA)对网络,足以让 LLM 重构经历过的情况,并通过网络上基于推理的推理链挖掘潜在知识。给定查询,Panini 只遍历持续更新的 GSW(而非原文档或分块),检索最可能的推理链。在六个问答基准上,Panini 取得最高平均性能,比其他有竞争力的基线高 5%-7%,同时答案上下文词元用量减少 2-30 倍,支持全开源流水线,并在精选的不可答查询上减少无依据回答。结果表明,在写入时对经验进行高效且准确的结构化——正如 GSW 框架所实现的——能在读取时同时带来效率与可靠性收益。代码见 https://github.com/roychowdhuryresearch/gsw-memory。

Panini:借助结构化记忆在词元空间持续学习
图1:非参数持续学习(NPCL)框架示意。(1)持续经验:到来的文档被异步处理,可能由不同的智能体完成。(2)个体工作区:每条经验被编码为一个生成式语义工作区(GSW)。(3)持续学习的全局工作区:GSW可通过在文档之间及文档内部调和实体、事件与动作而得到持续整合。大量消融研究(见表11)表明,用不同规模的LLM模型执行不同任务——GSW生成与检索——的各种组合都能带来持续稳健的性能。因此GSW可作为一种共享的元表示。(4)基于推理的推断:目标是实现足够(但非穷尽)的调和,使经验集合所支持的全部潜在知识都由推理链/推理路径表示。