论文
ConMax:面向高效思维链推理的置信度最大化压缩
ConMax: Confidence-Maximizing Compression for Efficient Chain-of-Thought Reasoning
摘要
大型推理模型(LRM)的最新突破表明,大量的思维链(CoT)生成对于实现自我验证与回溯等复杂认知行为、从而解决复杂任务至关重要。然而,这种能力常导致“过度思考”,即模型生成冗余的推理路径,在不提升准确率的情况下推高计算成本。虽然对推理轨迹做监督微调(SFT)是“冷启动”阶段的标准范式,但将现有压缩技术应用于这些轨迹,往往会损害逻辑连贯性或带来高昂的采样成本。本文提出ConMax(Confidence-Maximizing Compression),一个新颖的强化学习框架,旨在自动压缩推理轨迹的同时保留关键推理模式。ConMax将压缩表述为一个奖励驱动的优化问题,训练一个策略,借助一个冻结的辅助LRM,通过最大化预测保真度的答案置信度与推理有效性的思考置信度的加权组合来剪除冗余。在五个推理数据集上的大量实验表明,ConMax实现了更优的效率-性能权衡:与强基线相比,推理长度减少43%,而准确率仅下降0.7%,证明了其在为LRM生成高质量、高效训练数据方面的有效性。
