论文
通过不受束缚的自我调节来改善少步语言流程
Improving Few-Step Language Flows with Untied Self-Conditioning
摘要
流匹配语言模型并行地细化所有词元位置,并且可以用采样步骤来换取延迟,但在采样步骤很少的情况下,生成质量仍然会急剧下降。我们将这种退化的根源追溯到先前预测自调节中的训练推理不匹配:在训练期间,自调节输入是根据当前的噪声状态计算的,没有干预求解器步骤;在采样期间,求解器将先前的预测折叠到潜在的预测中,然后再将相同的预测作为显式自调节输入重新出现。这种耦合在训练期间不存在,会产生随着步长而增加的冗余。我们表明,不匹配会降低自调节输入和求解器更新的性能,并从模型自身的结构中得出每个修正。从冻结的投影权重中,我们确定自调节输入与潜在输入冗余的方向,并抑制它们;从求解器的集成结构中,我们得出需要进行步平均预测,并根据预测历史对其进行近似,其比例由离线轨迹统计数据设置。由此产生的采样器“Untied Self-Conditioning”不需要重新训练,并且每个步骤使用一次评估。在 LangFlow 上的 8 个采样步骤中,它将 OpenWebText 生成困惑度从 $531$ 降低到 ~$62$($8.6\times$);在改编的 Arena-Hard-Auto~v2 协议下,其输出在 $96\%$ 的成对比较中是首选。在 ELF-B 上,它将生成性困惑从 71 美元降低到 43 美元。采样步骤从 8 步改进为 256 步。