论文
时间锚定扩散语言模型:用于快速生成的潜在空间缓存
Time-Anchored Diffusion Language Models: Latent-Space Caching for Fast Generation
摘要
最近关于锚定扩散语言模型的工作通过利用受监督的重要标记目标塑造中间潜在空间来改善去噪。在这项工作中,我们引入了基于时间(自监督)的锚定,它可以学习并重用潜在锚点,而不需要这样的目标。我们的主要观察结果是,锚点对干净序列的持久属性进行编码,例如其语义意图、全局结构或中间计划。尽管随着词元画布的发展,它们的隐藏表示会变得陈旧,但它们的语义内容在附近的扩散时间内仍然有用。这是通过两级架构实现的,该架构由相对昂贵的锚网络和轻量级去噪网络组成,锚网络生成潜在缓存状态,轻量级去噪网络使用融合模块在每个反向步骤智能地将缓存潜在状态与当前状态结合起来。这为锚定提供了潜在空间缓存解释:定期评估锚网络,而其缓存表示在多个反向步骤中重用。我们将该框架实例化为 TADM:Post-train,它对预训练的 DLM 进行时间锚定;TADM:Pretraining,它在预训练期间学习基于时间的锚点。应用于 DiffusionGemma-26B 时,TADM:Post-train 在多个数学、代码和 STEM 基准(GSM8K、AIME26、GPQA-Diamond、LiveCodeBench-v6、HumanEval、MMLU-Pro)上将吞吐量提高了约 49% 至 79%。 TADM:相对于标准单级 DLM,预训练可将 Transformer 层计算量减少高达 38%,测量吞吐量比 ADLM 高出高达 73%。