论文

LLM 推理的自适应幂采样

Adaptive Power Sampling for LLM Reasoning

模型推理推理策略与问题分解

摘要

序列级功率采样最近作为 无需训练推理方法出现,通过从基本大语言模型 (LLM) 的锐化输出分布中进行采样。然而,现有方法通常会在查询之间均匀地锐化基本模型分布,而忽略查询难度以及基本模型已经处理每个查询的情况的变化。这项工作的目标是为功率采样配备查询自适应能力。从理论上讲,我们表明,进一步锐化的好处是由正确和错误反应之间的自我奖励差距决定的。基于这一见解,我们提出了自适应功率采样(APS),它在测试时使用答案一致性和模型自我奖励之间的关系在每个查询的基础上调整锐化指数。包括 MATH500、HumanEval 和 GPQA 在内的各种推理任务的实验表明,APS 始终优于固定锐化指数的功率采样,无需额外的训练。