论文

Free():在仅用 malloc 的推理模型中学习遗忘

Free(): Learning to Forget in Malloc-Only Reasoning Models

上下文与知识上下文工程

摘要

推理模型通过扩展测试时计算来增强问题求解能力,然而它们面临一个关键悖论:过多的思考词元(thinking tokens)往往降低而非提升性能。我们将此归因于一个根本性的架构缺陷:标准大语言模型(LLM)作为“仅 malloc”引擎运行,持续累积有效与冗余的步骤,却缺乏剪除过时信息的机制。为打破这一循环,我们提出 Free()LM,一种通过 Free-Module(即插即用的 LoRA 适配器)引入内在自我遗忘能力的模型。通过在推理与清理两种模式间迭代切换,Free()LM 动态识别并剪除无用上下文片段,保持紧凑且无噪声的状态。大量实验表明,Free()LM 在所有模型规模(8B 至 685B)上均带来一致的改进。它相较顶级推理基线取得平均 3.3% 的提升,并在使用 DeepSeek V3.2-Speciale 时于 IMOanswerBench 上创下新的 SOTA。最值得注意的是,在标准 Qwen3-235B-A22B 模型完全崩溃(0% 准确率)的长程任务中,Free()LM 将性能恢复至 50%。我们的发现表明,可持续的智能既需要遗忘的自由,也需要思考的能力。

Free():在仅用 malloc 的推理模型中学习遗忘
图3:数据构建流程。(a) 数据合成:我们将原始轨迹切分为1k-token的块,并使用Gemini-2.5-Pro按顺序生成候选训练实例。(b) 奖励机制:通过执行K = 8个并行rollout,仅当剪枝后的上下文C_new相比原始上下文保持或提升了准确率(Acc(C_new) ≥ Acc(C_raw))时,我们才保留该实例。