论文
上下文加权离散流匹配
Context-weighted Discrete Flow Matching
摘要
离散流匹配为离散结构的生成建模提供了灵活的框架。然而,标准分解训练目标使模型暴露于不同难度的目标,将条件良好的、可预测的标记与模糊的、高熵的标记混合在一起。我们凭经验证明,每个词元价值的不确定性与其邻域可用上下文的密度密切相关。受这一观察的启发,我们提出了对包含本地上下文信息的底层连续时间马尔可夫链(CTMC)的简单修改。我们的上下文加权采样器以可忽略的计算开销提高了生成质量,而我们的缩放交叉熵损失函数重新加权了来自不同标记的训练信号,并将 OpenWebText 上的生成困惑度降低了高达 63%。此外,我们的方法在质量上匹配强大的半自回归块扩散基线,同时保留以任何顺序执行生成的能力。这些结果强调了局部上下文作为离散生成建模中重要因素的作用,并表明简单的上下文感知修改可以显着提高采样和训练效率。