论文

记忆增强解锁高效的思维链推理

Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning

摘要

大语言模型 通常依靠思想链 (CoT) 推理来解决复杂任务,但详细的推理跟踪会带来大量的推理开销。 CoT 压缩可以缩短生成时间,但激进的压缩可能会破坏逻辑一致性并降低性能。我们将这种权衡形式化为上下文生成替换法,其中显式推理上下文替代了部分解码时生成。基于这一原则,我们提出了记忆增强压缩,这是一个 无需训练 框架,它从历史痕迹中构建可重用的推理记忆,并将它们检索为预填充侧脚手架。这些存储器不是使用原始演示,而是总结了可重用的推理模式、关键约束和关键操作,以补偿压缩期间丢失的信息。实验表明,Memory 在数学推理、复杂推理和科学问答任务中持续改进基于提示的 Chain-of-Draft (CoD) 压缩,在 GSM8K、MATH、BBH 和 MMLU-Sci 上的准确度比 CoD 提高了 21.4、28.0、29.5 和 6.61 点,同时实现了比标准 CoT 1.14-1.49 倍的延迟加速。内存还与 词元级、推理跟踪级别和推理状态压缩机制兼容。