论文
重尾奖励下大模型对齐的尾部感知信息论界
Tail-Aware Information-Theoretic Bounds for LLM Alignment under Heavy-Tailed Rewards
摘要
经典信息论学习界限通常依赖于 KL 互信息和矩生成函数(MGF)参数,它们与有界或亚高斯损失很好匹配,但当损失或奖励是重尾时可能无效。我们为亚威布尔数据开发了一个尾部感知信息理论框架,其中尾部参数 $θ$ 控制尾部厚重程度:$θ=2$ 对应于亚高斯,$θ=1$ 对应于亚指数,$0<θ<1$ 对应于真正的重尾。我们的关键技术成分是去相关引理,它使用移位对数 $f_θ$ 散度来约束测度变换下的期望,它允许在没有 MGF 参数的情况下与 Rényi 散度进行明确比较。在经验过程方面,我们建立了尖锐的最大不等式和亚威布尔过程的Dudley型链式界限,其中对数和熵项提升到 $1/θ$ 次幂。这些工具产生尾部自适应选择界限和基于移位对数和 Rényi 互信息的多尺度信息论Dudley不等式。我们将我们的理论应用于基于人类反馈的强化学习 (RLHF) 中的 奖励作弊 背景下的 大语言模型 (LLM)。我们表明,Rényi 正则化对齐提供了有限的奖励保证,并确保Best-of-N策略保持良好的控制,从而减轻标准 KL 正则化失败时的灾难性古德哈特效应。我们通过实验说明 Rényi 正则化 RLHF,包括受控重尾奖励和词元空间奖励攻击。