论文

MH支配重要性重采样于策略组合

Metropolis-Hastings Dominates Importance Resampling for Policy Composition

模型推理解码与生成控制

摘要

LLM后训练常需探索多奖励间的权衡,但为每个权衡重训代价高。解码时策略组合允许在推理时组合奖励特定策略来调整这些权衡。该组合针对完整响应上策略概率的加权乘积,但标准实现组合其下一token概率,通常引入采样偏倚。我们分析一种已知的基于独立Metropolis-Hastings(MH)的迭代校正。主要结果:对每个rollout预算,按所有凸f-散度度量,MH产生的输出分布至少与同预算的重要性抽样重采样(SIR)一样接近目标。我们还推导MH相对未校正解码器在一致性目标(度量与所供策略的一致)中的改进下界;并在两个渐近状态下刻画校正的抽样误差:奖励特定策略趋于一致时,以及目标与未校正解码器概率的对数比波动日益剧烈时(长响应可能出现)。以可枚举与LLM规模设置中的实验补充分析。