论文
Accordion-Thinking:面向高效且可读LLM推理的自调节步骤摘要
Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning
摘要
通过长思维链(Chain-of-Thought)扩展测试时计算带来了推理能力的显著提升,但KV缓存的线性增长与二次方注意力复杂度使其面临实际限制。本文提出Accordion-Thinking,一个端到端框架,让LLM学会通过动态摘要自我调节推理步骤的粒度。该机制实现了一种Fold推理模式:模型周期性地总结其思考过程并丢弃先前的想法,以减少对历史token的依赖。我们进一步应用强化学习来激励这一能力,并揭示一个关键洞见:高效的Fold模式与穷尽的Unfold模式之间的准确率差距随训练进程逐渐缩小并最终消失。这一现象表明,模型学会将关键推理信息编码进紧凑摘要,实现推理上下文的有效压缩。我们的Accordion-Thinking表明,借助习得的自我压缩,LLM能以最小的依赖token开销处理复杂推理任务而不牺牲解答质量,并在48GB显存配置下实现三倍吞吐且保持准确率,同时结构化步骤摘要提供了推理过程的人类可读记录。
