论文

通过采样引导大语言模型并提升生成质量

Recipes for Steering and Scaling LLMs via Sampling

模型推理解码与生成控制

摘要

大语言模型通常按自回归方式分解概率。虽然近期研究考虑基础模型之外更丰富的目标分布,但采样仍低效。本文提出有理论依据的灵活框架,通过采样引导自回归模型并提升生成质量。两种算法分别基于序贯蒙特卡罗SMC与副本交换RE,使生成服从基础分布的幂变换、分布乘积或倾斜分布。研究在不依赖外部监督或奖励模型的条件下提升生成质量,实验显示随计算预算增长的表现优于Best-of-N和标准MCMC对照。框架为以大模型进行概率推断提供系统化采样方法。