论文
HybridThinker:通过压缩内存和瞬态思维步骤进行高效的思维链推理
HybridThinker: Efficient Chain-of-Thought Reasoning via Compressed Memory and Transient Thought Steps
摘要
扩展的思想链 (CoT) 跟踪改进了 LLM 推理,但会产生大量的计算和内存成本。虽然现有的 CoT 压缩方法通过内存词元将思维步骤压缩为紧凑的表示并在推理时仅保留这些表示来缓解这一问题,但细粒度信息的丢失使后续步骤更容易出错。为了缓解这个问题,我们提出 \textbf{HybridThinker},除了保留这些表示之外,还暂时保留思维步骤以提供细粒度的细节。然而,我们观察到,天真地让后续步骤\emph{在训练期间}可以访问思维步骤,会让模型通过直接从这些步骤检索信息来绕过记忆词元,从而使模型通过记忆词元压缩和检索信息的能力未得到充分训练。因此,我们引入了一种混合训练方案,其中只有一些思维步骤可以通过关注后续步骤来直接访问,而其他思维步骤则被屏蔽,迫使模型使用记忆标记进行压缩和检索。在 4 个推理基准测试中,HybridThinker 与未压缩的基线相匹配,在相似的推理时间下,平均准确度将 CoT 压缩的最新技术提高了 5.8 个点。消融研究证实,临时思维步骤保留和混合训练计划都有助于这些收益。