论文

模型知道,解码器去找:未来值引导的粒子幂采样

The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling

模型推理解码与生成控制

摘要

“未经训练的推理”中的一个反复出现的模式是,基础大语言模型已经分配了非平凡的概率质量来纠正多步骤解决方案;瓶颈是在推理时有效地定位这些模式。功率采样提供了一种原则性的方法,通过以 alpha > 1 为目标 p_theta(x)^alpha 来偏向此类模式的解码,但实际近似必须考虑与未来相关的校正因子,这些校正因子决定哪些前缀仍然有希望。我们引入了辅助粒子功率采样(APPS),这是一种分块粒子算法,用于通过有界的部分解总体来逼近序列级功率目标。 APPS 使用建议校正功率重新加权并行传播假设,并通过重采样边界处的未来值引导选择来完善其生存。这会在竞争前缀之间重新分配有限计算,而不是致力于单个展开路径,同时在粒子计数和可预测峰值内存中提供直接缩放旋钮。我们通过短期推出实例化未来价值信号,并研究了一种摊销变体,用轻量级学习选择头代替推出。在推理基准测试中,APPS 改进了免训练解码的准确性与运行时间权衡,并表明与训练后系统的部分差距可以通过更忠实的推理时间功率近似来弥补。