论文
BlockGen:使用混合采样器的灵活分块序列建模
BlockGen: Flexible Blockwise Sequence Modeling with Hybrid Samplers
摘要
均匀状态扩散框架是离散扩散的更强大的范例吗?最近的研究表明情况可能如此。与预测校正器采样器相结合,均匀状态扩散模型 (USDM) 生成的样本质量高于掩模扩散模型 (MDM),并且 USDM 在下游任务中的性能等于或优于 MDM,尽管它们表现出更大的复杂性。有两个问题仍未解决。首先,现有的工作将均匀扩散和掩模扩散与不知情的校正器进行比较,这些校正器在随机位置重新注入噪声,而不是针对最有可能出错的标记。其次,之前的工作比较了全序列扩散模型,因此我们不知道当词元逐块生成时是否同样的结论成立。为了解决这些问题,我们引入了 BlockGen,这是一种分块序列模型,我们使用掩模扩散和均匀扩散来实例化它。 BlockGen 在块大小的混合上进行训练,其在 AR 和纯扩散之间的可能性插值比具有固定块大小的模型更精细。 BlockGen 支持基于 AR 的预测校正器采样 (ARPC),它结合了 AR 和扩散预测,无需辅助验证器即可重新生成不太可能的词元。在祖先采样下,uniform 的性能优于逐块设置中的 masked,尤其是在少步机制中。在 ARPC 下,差距在高 NFE 时缩小并逆转。 GSM8K 上的块大小为 16,MDM 的准确率略高于 USDM,并且我们在 OpenWebText 上的生成困惑度中观察到类似的趋势。在 https://github.com/jdeschena/blockgen 上找到我们的代码。