论文

广泛探索,敏锐推理:通过抽样将小模型推向前沿

Explore Broadly, Reason Sharply: Push Small Models toward the Frontier via Sampling

模型推理推理搜索与路径规划

摘要

功率锐化采样是强化学习 (RL) 训练后的推理时间替代方案,用于增强大语言模型 (LLM) 中的推理。高概率序列在基本模型下被放大,无需参数更新或外部奖励,避免了 RL 昂贵的优化和锯齿状泛化。然而,这种方法面临着一个基本的探索——利用权衡,因为强锐化限制了探索,将采样器困在看似合理但不正确的推理轨迹中,而弱锐化则使答案分布分散。为了解决这种权衡问题,我们引入了并行功率调温(PPT),通过并行调温实例化功率锐化的 LLM 采样。在不同的锐化级别并行运行多个交互副本允许较低功率的副本探索不同的推理轨迹,并允许较高功率的链进一步利用锐化目标所青睐的较高似然响应。具体来说,我们通过减轻先前功率采样器中确定的截断偏差来定制推理时间采样的\method{},并研究有限内存和计算预算下的有效交换策略。大量实验表明,\method{} 极大地改进了单链功率锐化采样,并且优于 RL 后训练模型,产生更高质量的推理轨迹,甚至实现与前沿模型相当的性能。