论文
自奖励为何有效:语言模型迭代对齐的理论保证
Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models
摘要
自奖励语言模型(SRLM)在无需外部反馈的迭代对齐改进方面取得显著成功。然而,尽管其经验进展引人注目,驱动其能力的核心机制仍未阐明,留下关键的理论理解空白。本文为SRLM提供首个严格的理论保证。我们首先建立一个刻画单次更新步根本下限的下界,揭示对初始模型质量的关键依赖。随后,我们为完整迭代范式推导有限样本误差界,表明性能以 O~(1/√n) 的速率随样本量n提升。关键的是,我们的分析揭示对初始模型的依赖随迭代次数T指数衰减。这为自奖励为何成功提供了形式化解释:它通过把动态引向内部稳定与一致性,稳健地克服糟糕的初始化。最后,我们将该理论框架实例化到线性softmax模型类,得到与实用模型架构相连接的定制保证。