论文

LightThinker++:从推理压缩到内存管理

LightThinker++: From Reasoning Compression to Memory Management

上下文与知识记忆Agent记忆

摘要

大语言模型 (LLM) 擅长复杂推理,但其效率受到长思维轨迹激增的认知开销的限制。在本文中,我们提出了 LightThinker,一种使 LLM 能够动态地将中间思想压缩为紧凑语义表示的方法。然而,静态压缩常常难以应对复杂的推理,其中中间细节的不可逆丢失可能会导致逻辑瓶颈。为了解决这个问题,我们将框架发展为 LightThinker++,引入了显式自适应内存管理。这种范式通过合并显式内存原语转向行为级管理,并由专门的轨迹合成管道支持,以训练有目的的内存调度。大量的实验证明了该框架在三个维度上的多功能性。 (1) LightThinker 将峰值词元使用量减少了 70%,推理时间减少了 26%,同时精度损失最小。 (2) 在标准推理中,LightThinker++ 将峰值词元使用量削减了 69.9%,同时在相同的上下文预算下获得了 +2.42% 的准确率增益,以实现最大性能。 (3) 最值得注意的是,在长期代理任务中,它在超过 80 轮的情况下保持稳定的足迹(减少了 60%-70%),在不同的复杂场景中实现了 14.8% 的平均性能增益。总的来说,我们的工作提供了一个可扩展的方向,以最小的开销在扩展的范围内维持深度 LLM 推理。