论文

通过 同策略 蒸馏 实现数据高效的自回归扩散语言模型

Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation

摘要

我们研究自回归模型(ARLM)到扩散语言模型(DLM)的转换。先前的工作不是从头开始预训练,而是用双向注意力取代 ARLM 中的因果注意力,然后使用 DLM 目标训练生成的模型。然而,这些方法会导致两次分布变化。首先,从下一个词元预测目标过渡到 DLM 目标可能会丢弃 ARLM 在训练期间获取的知识。其次,标准 DLM 存在训练推理不匹配的问题,因为训练损失是在随机屏蔽序列上定义的,而不是在基于置信度的解码产生的推理中遇到的轨迹定义的。为了解决这两个挑战,我们引入了 同策略 扩散语言模型 (OPDLM),其中 同策略 蒸馏 (OPD) 用于 ARLM 到 DLM 的转换。具体来说,OPDLM 通过自我 OPD 进行训练,其中学生(具有双向注意力的 ARLM)生成自己的轨迹,而教师(原始冻结的 ARLM)通过在这些轨迹上提供目标 logits 来提炼其知识。通过直接以 同策略 方式进行训练,OPDLM 消除了 DLM 中的训练推理不匹配,而原始模型中的 蒸馏 增强了 ARLM 的知识保留。实证结果表明,OPDLM 所需的训练词元数量减少了 15 倍到 7,000 倍,并且在各种任务中都具有出色的性能。 OPDLM 避免了 DLM 预训练的高昂成本,并将 DLM 转换定位为 ARLM 后训练 的一种形式。