论文
LEAD:大语言模型 的长度高效自适应和动态推理
LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models
摘要
大型推理模型,例如 OpenAI o1 和 DeepSeek-R1,随着推理能力的提高,往往会变得越来越冗长。这些膨胀的思想链 (CoT) 轨迹通常超出了根本问题的要求,浪费了计算、延迟和上下文预算。虽然在强化学习过程中引入基于长度的效率奖励提供了一种自然的补救措施,但现有的方法面临着两个基本挑战:正确性和效率之间的最佳平衡在整个训练过程中是非平稳的,并且内在推理预算在不同问题上差异很大。依赖静态奖励权重和全局长度约束不可避免地会迫使准确性下降和未实现的压缩之间做出妥协。为了克服这些限制,我们提出了 LEAD(长度高效自适应和动态推理),这是一种用在线自适应机制取代静态启发式方法。 LEAD 使用潜在尺度不稳定性动态校准每一步的正确性与效率权衡,将优化能力引导至信息最丰富的学习信号。此外,它还根据模型自身的正确部署在线估计自适应的每个问题目标长度,并应用对称效率奖励来惩罚过度思考和过度压缩。根据五个数学推理基准进行评估,LEAD 在 RL 训练的高效推理方法中实现了最高的准确度和准确度-效率得分,同时产生的输出比基本模型短得多。