论文

SHAPE:通过 LLM 推理的潜力估计实现阶段感知的分层优势

SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning

模型训练奖励建模与过程监督

摘要

流程监督已成为增强 LLM 推理的一种有前途的方法,但现有方法无法区分有意义的进展和单纯的冗长,导致推理能力有限和未解决的词元效率低下。为了解决这个问题,我们提出了通过潜在估计的阶段感知层次优势(SHAPE),这是一个将推理形式化为通过经验可解状态空间的轨迹的框架。 SHAPE引入了分层贡献分配机制:在细分层面,采用阶段感知优势函数,优先实现低潜力状态的高效突破;在 词元级 中,它利用熵驱动的重新分配来锐化执行信号。跨三个基本模型和五个基准的大量数学推理实验表明,SHAPE 的平均准确度提高了 3%,词元消耗减少了 30%。