论文

Accordion-Thinking:面向高效且可读LLM推理的自调节步骤摘要

Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning

模型训练上下文与知识强化学习上下文工程

摘要

通过长思维链(Chain-of-Thought)扩展测试时计算带来了推理能力的显著提升,但KV缓存的线性增长与二次方注意力复杂度使其面临实际限制。本文提出Accordion-Thinking,一个端到端框架,让LLM学会通过动态摘要自我调节推理步骤的粒度。该机制实现了一种Fold推理模式:模型周期性地总结其思考过程并丢弃先前的想法,以减少对历史token的依赖。我们进一步应用强化学习来激励这一能力,并揭示一个关键洞见:高效的Fold模式与穷尽的Unfold模式之间的准确率差距随训练进程逐渐缩小并最终消失。这一现象表明,模型学会将关键推理信息编码进紧凑摘要,实现推理上下文的有效压缩。我们的Accordion-Thinking表明,借助习得的自我压缩,LLM能以最小的依赖token开销处理复杂推理任务而不牺牲解答质量,并在48GB显存配置下实现三倍吞吐且保持准确率,同时结构化步骤摘要提供了推理过程的人类可读记录。

Accordion-Thinking:面向高效且可读LLM推理的自调节步骤摘要
图1:Vanilla CoT 与我们的 Accordion CoT 的比较。随着生成长度增加,Vanilla CoT 中每个 token 的计算复杂度呈二次增长。相比之下,我们的 Accordion CoT 在每一步之后折叠上下文,降低了下一个 token 生成的计算复杂度并提升推理速度。我们强制模型遵循 Accordion Format,它将整个思考过程切分为若干粗粒度步骤,随后附上一段可读的总结。我们在模型词表中加入 2 个特殊 token。每次生成在 </step> 或 EOS token 处停止。