论文
Pensieve范式:掌握自身上下文的有状态语言模型
The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context
摘要
在《哈利·波特》的世界里,当邓布利多的头脑不堪重负时,他会把记忆提取到冥想盆(Pensieve)中以便日后重访。在AI的世界里,尽管我们已拥有堪比冥想盆的成熟数据库和检索系统,我们的模型却莫名其妙地缺少操作它们的“魔杖”。它们仍像一个没有行动力的邓布利多,被动接受人工编排的上下文作为自己的全部记忆。这项工作终于把魔杖放进了模型手中。我们提出StateLM,一类被赋予内部推理循环以管理自身状态的新型基础模型。我们为模型配备一套记忆工具,如上下文剪枝、文档索引和笔记记录,并训练它主动管理这些工具。通过学习动态地工程化自身上下文,我们的模型挣脱了固定窗口的架构牢笼。跨多种模型规模的实验证明了StateLM在多样场景中的有效性。在长文档问答任务上,StateLM在所有模型规模上都持续优于标准LLM;在聊天记忆任务上,它们相较标准LLM取得10%到20%的绝对准确率提升。在深度研究任务BrowseComp-Plus上,性能差距更加悬殊:StateLM最高达到52%的准确率,而标准LLM对应模型只能在5%左右徘徊。最终,我们的方法把LLM从被动预测器转变为具备状态意识的智能体,使推理成为一个有状态、可管理的过程。
