论文
通过边缘条件桥从流语言模型中采样
Sampling from Flow Language Models via Marginal-Conditioned Bridges
摘要
流语言模型(FLM)是最近推出的一类语言模型,它采用连续流匹配来匹配单热编码的词元序列。他们的降噪器具有通用连续扩散模型所没有的特殊结构:降噪均值的每个块都是该位置处干净词元的后边缘分布。标准 DDPM 式采样器将这些边缘折叠为单个条件均值端点,并桥接至此单纯形值点,这通常不是有效的单热序列。我们认为 FLM 的自然采样器是后验预测的。在每个反向步骤中,我们从由 FLM 词元边际定义的分解后验中采样一个干净的单热端点,然后从以该端点为条件的分析 Ornstein-Uhlenbeck 桥中采样下一个连续状态。该方法是无需训练,使用与标准采样相同的模型评估,并给出了词元级解码控制(例如温度缩放和核截断)的原理性接口。我们证明,在精确的后验边缘下,端点近似误差正是词元位置之间的条件多信息。诱导的一步桥内核保留了所有标记方式的后验预测边缘,并且仅丢失剩余的交叉位置依赖性。最后,我们证明了吉尔萨诺夫路径空间比较,表明边缘条件桥的去噪误差项不比冻结条件均值桥大,只要中间坐标桥观察揭示有关干净词元的附加信息,就会进行严格的改进。 FLM 的实验表明,采样器提高了质量与多样性的权衡。代码位于:github.com/imbirik/mcb。