论文
无需训练 LLM 推理的深度熵引导采样
Depth-Entropy Guided Sampling for Training-Free LLM Reasoning
摘要
强化学习(RL)已成为提高 大语言模型 推理能力的主导范式,但它需要昂贵的训练、精选数据和奖励信号。最近的工作表明,在测试时从锐化的基本模型分布中进行采样可以恢复大部分 RL 增益,但现有方法仅依赖于输出层似然性,而忽略了 Transformer 的内部前向传递动态。我们引入深度熵引导采样(DEGS),这是一种 无需训练 测试时间方法,利用分层熵崩溃作为内在质量信号。我们观察到更强的推理机(包括 RL 后训练变体)表现出独特的“晚期崩溃”:logits 透镜解码的熵在收敛之前保持较高的水平,直到更深的层。我们定义了每个序列的塌陷深度 $D(\mathbf{x})$ 和联合目标 $π(\mathbf{x}) \propto p(\mathbf{x})^α\exp(βD(\mathbf{x}))$ ,它将序列似然与此深度熵结构结合起来,在 MCMC 功率采样框架 (DEGS-MCMC) 内实例化。在三个开放权重模型和四个推理基准中,这种接近机会的每个候选信号在采样轨迹上复合为最先进的 无需训练 精度,在域外和较难的分割上获得最大的增益(正是可能性本身不足的地方),而挂钟开销仅为个位数。 DEGS 在 GRPO 训练的数学分割方面勉强落后于内部 GRPO 参考,但在所有三个模型的 GPQA 领域外都超越了它,无需任何训练、奖励模型或标记数据。