论文
高效评估Best-of-N策略并选择推理采样预算
Efficient Best-of-N policy evaluation for inference-time alignment
摘要
Best-of-N (BoN) 是一种常见的推理时间对齐方法,它从参考模型的 N 个样本中选择得分最高的响应。在仅样本访问的情况下,根据记录的数据评估 BoN 策略具有挑战性,因为标准的离策略估计器需要依赖于不可用响应可能性的密度比。在本文中,我们提出了一个仅样本框架,用于评估和选择 BoN 政策,而无需了解这些可能性。我们表明,BoN 的顺序统计结构允许通过仅根据样本即可估计的分数排名概率来表达所需的密度比。然后,我们开发了一个双重稳健的 BoN 政策价值估计器 (BoN-DR),该估计器可以有效地重用跨候选预算的共享辅助样本池。即使在奖励估计器错误指定的情况下,我们也能建立有效的渐近推理,并证明我们的 BoN-DR 估计器的效率。由于较大的预算会放大评分函数中的误差并导致奖励过度优化,因此我们得出两个选择规则:(i)最大化估计的政策价值和(ii)最大化参考政策改进的置信下限,这解释了估计的不确定性并提供无害保证。通过综合实验和具有多个参考和奖励模型的 GSM8K,我们的框架准确估计 BoN 政策价值并选择有效的抽样预算。