论文
顺序无关语言模型中的解码:链规则偏差和均匀传播
Decoding in Order-Agnostic Language Models: Chain-Rule Deviation and Uniform Spreading
摘要
与顺序无关的语言模型 (OALM),包括离散扩散语言模型 (dLLM),经过训练可在任意条件集下预测屏蔽标记,从而允许在推理时在任意揭示顺序下生成序列或对其进行评分。在 LLaDA-2.1 中,我们报告了三项发现。首先,学习到的条件并不是连贯联合分布的精确分解:仅更改显示顺序会将目标对数似然移动最多 0.49 nat/token,因此仅似然就将内容难度与路径相关的工件混合在一起。其次,虽然置信优先(CF)解码与顺序无关,但其显示顺序在内容标记上接近从左到右(L2R)。第三,我们提出了基于置信迹线形状的补充诊断。均匀分布定理表明,在固定的总似然下,当每步置信度均匀分布时,目标可恢复性最大化;由此产生的偏差激励 $\mathrm{Var}(\log q_t)$ 作为比较解码路径的诊断。在 C4 和四个下游基准中,低方差将结构化路径与随机排序分开,并且方差始终与下游正确性相关。这些结果支持在比较 OALM 解码路径时联合报告平均置信度和置信方差。