论文

从 AR 到扩散:通过严格因果和弹性视野有效调整 大语言模型

From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons

模型架构新型架构

摘要

扩散模型承诺高效的并行文本生成,但依赖于双向注意力,从而与预训练的自回归 (AR) 模型产生结构不匹配。这种不兼容性妨碍了重用强大的 AR 先验,从而需要从头开始使用禁止性的 预训练。为了弥补这一差距,我们提出了 FLUID,这是一个能够有效地使 AR 骨干适应扩散范式的框架。通过强制执行严格因果对齐,FLUID 可以从标准 GPT 式检查点进行无缝初始化,从而避免了对大量 预训练 的需求。此外,我们引入了 Elastic Horizo​​ns,这是一种熵驱动的机制,可以根据局部信息密度而不是固定的时间表动态调节去噪步幅。实验表明,FLUID 实现了最先进的性能,同时将训练成本降低了几个数量级,有效地将已建立的 AR 基础与高效的并行生成相协调。我们的代码可在 https://github.com/Oli-lab-nun/FLUID/tree/main 获取。