论文

Best-of-Tails:在推理时对齐中连接乐观与悲观

Best-of-Tails: Bridging Optimism and Pessimism in Inference-Time Alignment

模型推理推理验证与自校正

摘要

推理时对齐通过从参考模型生成多个候选项并用不完美的奖励模型在其中选择,有效引导大型语言模型(LLM)。然而,当前策略面临根本性困境:像Best-of-N这样的"乐观"方法苦于奖励破解,而"悲观"的正则化方法常抑制发现高质量回答所需的探索。在这项工作中,我们通过遗憾最小化的视角形式化这一权衡,证明最优策略关键取决于奖励分布的尾部行为。我们从理论上表明,轻尾分布形态有利于乐观策略以挖掘高质量离群值,而重尾分布需要悲观策略以防范极端处的奖励误校准。受这一洞见指导,我们提出Best-of-Tails(BoT),一个自适应推理时对齐框架,使用Tsallis散度作为可调正则项,在两个极端之间提供更细粒度的插值。BoT使用Hill估计器按每个提示刻画奖励尾部轻重,并动态调整其选择规则以平衡探索收益与对齐误差。在数学、多选推理和人类偏好评估中,BoT在一系列参考和奖励模型配置下相对固定策略基线提升了对齐性能。

Best-of-Tails:在推理时对齐中连接乐观与悲观
图1:乐观、悲观以及所提出的BoT策略的选择概率(彩色实线)概念示意图。图中描绘了这些策略在轻尾(左)与重尾(右)奖励分布(黑色虚线)下如何对候选重新加权。乐观策略持续将概率质量集中在最高奖励上(有奖励黑客行为的风险),悲观策略保持保守(有探索不足的风险),而BoT自适应地调整其策略:在轻尾情形下模仿乐观以获取安全收益,但在重尾情形下转向稳健、保守的选择以防止过度优化。