论文

选择性潜在思维:LLM 推理链的自适应压缩

Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains

模型推理推理加速

摘要

显式思想链(CoT)推理极大地提高了大语言模型(LLM)的推理能力,但由于自回归轨迹过长,推理成本很高。现有的潜在推理方法提供了一种有前途的替代方案,但它们通常将推理视为一致可压缩的,导致精度关键的中间步骤被过度压缩,从而降低推理准确性。在这项工作中,我们提出了选择性潜在思维(SLT),这是一种框架,可以选择性地将冗余推理跨度压缩为潜在表示,同时在同一推理轨迹内将精度关键跨度保留为显式 CoT。具体来说,SLT 首先使用轻量级解码器来预测即将到来的较短推理范围,然后应用基于置信度的门控来确定可以可靠压缩的最长范围。接受的跨度被编码成紧凑的潜在表示,以提高推理效率,而不确定或精度关键的推理仍保持显式 CoT 形式,以保持准确性。为了学习这种选择性压缩策略,SLT 采用了三阶段训练策略,结合了跨度级潜在压缩、可靠性感知的未来推理预测和轨迹级强化学习,以优化答案正确性和推理成本之间的权衡。跨越四个数学推理基准的大量实验表明,在可比较的压缩比下,SLT 的准确度比潜在推理基线高 22.7%,同时与显式 CoT 相比,推理链长度减少了 58.4%,准确度仅下降 2.8%。我们的代码可以在 https://github.com/hunshi34/SLT 中找到。