论文

少步离散扩散的张量训练联合建模

Tensor-Train Joint Modeling for Few-Step Discrete Diffusion

模型架构新型架构

摘要

对于顺序离散数据,离散扩散有望比自回归 (AR) 模型更快地生成几个数量级,但由于基本的结构限制,其少步生成的全部潜力仍然无法实现。当前离散扩散模型的条件独立假设引入了系统并行化偏差,该偏差与每步公开的词元数量相结合,在快速生成所需的少步机制中变得严重。我们通过张量分解使用离散扩散中显式联合分布建模的第一个框架来解决这个问题,该框架将条件干净分布表示为具有可控表达性的低秩张量。该框架支持规范多元 (CPD) 和张量训练 (TTD) 分解,并且我们确定了 TTD 对附近标记之间依赖关系的结构偏差,通过将 TT 等级与展开矩阵等级相关的 Oseledets 定理形式化,该定理非常适合顺序数据,例如自然语言和分子数据的行符号。为了实现高效生成,我们提出了一种迭代边际推理程序,专门用于预定位置计划。我们的框架通过轻量级 微调 集成到预训练的 MDM 中,从而在几个步骤的生成过程中产生了重大改进,而成本只是从头开始训练的一小部分。代码可在 https://github.com/ssamt/tensor-train 获取。