论文

MEMENTO:教会LLM管理自身的上下文

MEMENTO: Teaching LLMs to Manage Their Own Context

上下文与知识上下文工程

摘要

推理模型在长而未结构化的思维流中思考,缺乏压缩或组织自身中间状态的机制。我们提出MEMENTO:一种教会模型将推理分割为块、把每个块压缩为一个memento(即密集的状态摘要)、并仅通过关注memento向前推理的方法,从而降低上下文、KV缓存与计算量。为训练MEMENTO模型,我们发布了OpenMementos,一个源自OpenThoughts-v3、经分割并标注中间摘要的228K推理轨迹公开数据集。我们证明,在OpenMementos上的两阶段SFT配方在不同模型家族(Qwen3、Phi-4、Olmo 3)与规模(8B–32B参数)上均有效。训练后的模型在数学、科学与代码基准上保持强劲准确率,同时实现约2.5倍的KV缓存峰值缩减。我们扩展了vLLM以支持我们的推理方法,实现约1.75倍的吞吐提升,同时也使我们能够进行RL并进一步提升准确率。最后,我们识别出一种双信息流:每个推理块的信息既由memento文本携带,也由相应的KV状态携带,后者保留了原始块的隐式信息。移除这一通道会使AIME24上的准确率下降15个百分点。

MEMENTO:教会LLM管理自身的上下文:论文配图
图5:压缩比CDF分布:OLMo3-7B与Qwen3-8B在竞赛数学上压缩最紧,Phi-4跨度最大,MATH-500上尤甚。