论文

CAT:大型推理模型高效推理的置信自适应思维

CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models

模型训练偏好优化

摘要

大型推理模型 (LRM) 通过利用长思维链 (CoT) 轨迹在复杂任务上取得了显着的成功,但它们经常在简单查询上表现出过度思考,导致显着的词元开销并降低推理效率。然而,现有的压缩方法主要采用均匀的长度缩减或依赖于粗粒度的难度估计,往往导致困难问题的性能下降。为了解决这个限制,我们提出了置信自适应思维(CAT),这是一个框架,它将模型的内在自我确定信号作为置信度纳入偏好优化过程,根据问题难度自主调节推理长度。实验结果表明,在不同基础模型的多个基准测试中,CAT 的推理准确性始终优于最先进的基线。我们的工作使 LRM 能够有效压缩自信的响应,同时考虑不确定的响应,为平衡实际工业场景中的准确性和延迟提供潜在的强大解决方案。