论文
Best-of-Tails:在推理时对齐中连接乐观与悲观
Best-of-Tails: Bridging Optimism and Pessimism in Inference-Time Alignment
摘要
推理时对齐通过从参考模型生成多个候选项并用不完美的奖励模型在其中选择,有效引导大型语言模型(LLM)。然而,当前策略面临根本性困境:像Best-of-N这样的"乐观"方法苦于奖励破解,而"悲观"的正则化方法常抑制发现高质量回答所需的探索。在这项工作中,我们通过遗憾最小化的视角形式化这一权衡,证明最优策略关键取决于奖励分布的尾部行为。我们从理论上表明,轻尾分布形态有利于乐观策略以挖掘高质量离群值,而重尾分布需要悲观策略以防范极端处的奖励误校准。受这一洞见指导,我们提出Best-of-Tails(BoT),一个自适应推理时对齐框架,使用Tsallis散度作为可调正则项,在两个极端之间提供更细粒度的插值。BoT使用Hill估计器按每个提示刻画奖励尾部轻重,并动态调整其选择规则以平衡探索收益与对齐误差。在数学、多选推理和人类偏好评估中,BoT在一系列参考和奖励模型配置下相对固定策略基线提升了对齐性能。
