论文

RuPLaR:使用基于规则的先验从多步到一步对 LLM 推理链进行高效潜在压缩

RuPLaR : Efficient Latent Compression of LLM Reasoning Chains with Rule-Based Priors From Multi-Step to One-Step

模型推理推理策略与问题分解

摘要

思想链(CoT)范式虽然增强了 大语言模型(LLM)的可解释性,但受到自然语言的低效率和表达限制的限制。潜在思想链(潜在 CoT)推理在连续潜在空间中运行,提供了一种有前途的替代方案,但面临着现有多步骤或多模型范式中结构复杂性的挑战,例如错误传播和协调开销。在本文中,我们介绍了 One-Model One-Step,这是一种基于规则先验的潜在推理(RuPLaR)的新颖压缩框架,以应对这一挑战。我们的方法训练 LLM 在单个训练阶段自主生成潜在推理标记,以基于规则的先验概率分布为指导,从而消除级联过程和模型间依赖性。为了确保推理质量,我们设计了一个联合训练目标,通过交叉熵强制答案一致性,通过 KL 散度(软思维约束)将软词元与基于规则的先验对齐,并在表示空间中添加问题思维语义对齐约束。大量实验表明,我们的压缩框架不仅比现有潜在 CoT 方法提高了 11.1% 的准确性,而且还以最少的词元使用实现了这一目标,强调了其有效性和可扩展性。代码:https://github.com/xiaocen-luo/RuPLaR。