论文

通过决策流采样:大型语言模型中改进的潜在推理路径的免训练提取

Sampling via Decision-Flow: Training-Free Extraction of Improved Latent Reasoning Paths in Large Language Models

模型推理推理搜索与路径规划

摘要

LLM 推理的一个核心问题是强化学习 (RL) 是否会灌输真正的新能力,或者只是重塑现有知识在推理过程中的表达方式。基于分布锐化假设,即强化学习将概率质量重新分配给已经隐藏在基础模型中的高奖励轨迹,我们问:我们能否在不进行昂贵的强化学习微调的情况下解锁这些潜在路径?我们提出了决策流采样(DF-Sample),这是一种无需训练、无需数据的推理时间框架,可构建分层推理树,对终端节点的质量进行评分,并通过反向传播实用程序来通知每个中间分支决策。与进行纯粹局部逐步选择的传统采样策略不同,DF-Sample 在提交路径之前执行显式全局轨迹评估,恢复标准解码忽略的高质量但低概率的推理链。在 GPQA 上,DF-Sample 达到了 45.6% 的准确率,超过了功率采样(38.9%)和 GRPO(39.9%),这表明免训练方法可以优于经过训练的方法。在三个模型和四个基准中,DF-Sample 始终优于基线,表明预训练基础模型具有巨大的潜在推理潜力。