论文

Chopthin 共识功率采样:LLM 解码的多样性保留方法

Chopthin-Consensus Power Sampling: A Diversity-Preserving Approach to LLM Decoding

模型推理推理搜索与路径规划

摘要

通过顺序蒙特卡罗 (SMC) 进行推理时功率采样可以显着改进大型语言模型 (LLM) 推理,而无需进行后期训练。然而,许多现有的 SMC 方法依赖于等权重重采样,这可能会积极修剪低权重轨迹,丢弃潜在的正确推理路径并降低搜索空间的谱系多样性。为了解决这个问题,我们引入了 Chopthin 共识功率采样(CCPS)。我们的方法将 Chopthin 重采样器应用于 LLM 解码:它不是均衡权重并强制不必要的粒子重复,而是强制最大和最小权重之间的比率的上限,并将不相等的权重向前推进。这种有针对性的干预保留了一组更丰富的独特推理路径,在条件期望中保持加权 SMC 近似不变,并保证重采样后有效样本量(ESS)的下限。为了充分利用这个丰富的群体,我们采用了语义多数选择机制,该机制合并标记相同的最终轨迹,对语义等效的答案进行聚类,并返回由最大数量的不同轨迹支持的答案。通过对三个开放权重模型和五个推理基准进行评估,我们发现 Chopthin 在 15 个设置中的 13 个设置中提高了预言机覆盖率。与语义多数选择相结合,CCPS 在 15 种设置中的 14 种中达到或超过了 Power-SMC 基线的最终答案准确性,绝对增益高达 10.6 个百分点。这些发现表明,多样性保留重采样和多样性感知选择是免训练 LLM 推理的补充机制。代码可在 github.com/MinooAhmadii/chopthin-consensus-power-sampling 获取。