论文
语言模型与记忆对齐的渐进性
The Asymptotics of Language Model Alignment with Memory
摘要
语言模型 (LM) 对齐的大致目标是将给定的 LM $Q$ 扰乱为对齐的 LM $q$,使得 i) $q$ 和 $Q$ 产生的输出在概率上“接近”,ii) $q$ 比 $Q$ 具有更高的预期奖励。 LM 对齐的两种常见技术是:KL 约束 RL(需要了解 LM 分布且计算成本较高)和最佳 $n$ 算法(仅需要从 LM 进行采样)。杨等人的工作。建立了 $m$ 长度独立同分布的两种对齐方法产生的分布之间的渐近接近性。 LM输出的词元序列,在$m$的限制下增加到无穷大。然而,i.i.d.假设并不代表实际的 LM,其输出序列通常具有记忆。在本文中,我们将渐进接近结果扩展到LM输出的$m$长度标记序列是马尔可夫的情况。此外,对于有限长度的输出序列——特别是当 $m=1$ 时——我们提供了 LM 分布和奖励函数的完整表征,其中两种对齐方法产生的分布之间的 KL 散度为零——这是 Yang 等人首先提出的问题。