论文
ADaPT:词元级 高效大型推理模型的解耦
ADaPT: Token-Level Decoupling for Efficient Large Reasoning Models
摘要
大型推理模型依靠长的思维链来获得强大的性能,但统一应用这种推理会产生很高的计算成本。现有的以效率为导向的方法试图缩短或混合推理策略,但往往会降低推理能力。我们将根本原因确定为效率激励和正确性优化之间的序列级耦合,这隐含地惩罚了长但正确的推理轨迹。为了解决这个问题,我们提出了自适应双进程思维(ADaPT),这是一种 词元级 双进程框架,可在训练期间显式解耦效率和正确性信号。 ADaPT 引入了模式选择词元来控制快速和慢速推理,专门对该词元应用与效率相关的奖励,以避免惩罚正确的长推理,同时在适当的时候鼓励效率。此外,ADaPT 能够在推理时精确、连续地控制效率与性能之间的权衡:通过调整模式选择标记的生成概率,单个训练模型可以沿着效率与性能 Pareto 边界平滑移动。大量实验表明,ADaPT 显着降低了推理成本,同时在多个基准测试中保持强大的推理性能。