论文

通过轻量级体验式潜在记忆不断自我完善

Continual Self-Improvement with Lightweight Experiential Latent Memories

摘要

大语言模型 通过扩展推理时间计算来实现强大的推理性能,但基本上保持无状态,丢弃在此过程中生成的丰富的、自产的推理痕迹。我们研究模型是否可以从这种经验中在线学习,将瞬态计算(推理痕迹)转换为持久的可重用知识,并且无需外部监督或访问未来数据。我们表明,原始推理轨迹上的上下文学习(ICL)无法泛化,反映了 词元级 重用的基本限制:即使在细化(例如自我反思)之后,单个轨迹也缺乏传输所需的抽象。相比之下,从最近关于无监督强化学习的工作中汲取灵感,我们发现以自我生成的测试时间信号(多数投票)作为奖励的轻量级按实例训练会产生巨大的收益,通常超过全数据集离线训练,从而促进从原始痕迹到学习的潜在表示的转变。基于这一见解,我们提出了一种在线方法,将遇到的问题所花费的推理时间计算提炼成紧凑的模块化潜在存储器,捕获底层推理结构。这些记忆被存储和检索以供将来输入,从而实现持续改进,同时通过模块化设计避免灾难性遗忘。重要的是,我们的方法非常高效,参数化为极其轻量级的软提示记忆(约 0.001% 的模型参数),并且仅用几个梯度步骤进行训练,但实现了与完整参数更新和离线训练相比的性能竞争。在具有挑战性的数学推理基准中,我们的方法显着优于零样本和原始数据 ICL 基线,同时有效地跨数据集传输。