论文
作为解码器接口问题的连续语言扩散
Continuous Language Diffusion as a Decoder-Interface Problem
摘要
高斯损坏的句子嵌入没有直接的语言解释,但连续扩散语言模型可以从中生成流畅的文本。我们通过嵌入式语言流(ELF)研究这个难题,并确定解码器盆地机制:我们的证据表明,当轨迹到达本地解码器可以读取稳定标记的区域时,去噪变得可靠。我们引入了一种用于去噪性、语义可恢复性、顺序敏感性、解码器兼容性和轨迹可靠性的诊断协议。它暴露了标量度量隐藏的故障:低均方误差可以丢弃语言内容,低困惑度可以反映低熵崩溃,干净的潜在重建可以与狭窄的解码器盆地共存。解码器裕度界限解释了为什么词元恢复取决于裕度和本地解码器灵敏度,而不仅仅是潜在错误。审计公共 ELF 检查点揭示了一个界面阶段图:早期预测可读性较弱,中期轨迹分歧标志着竞争区域,后期预测进入高间隔解码区域。一旦进入内部,生成的 ELF 状态上的词元实现就非常简单:冻结 T5(文本到文本传输 Transformer)词元嵌入查找可恢复本机解码器决策的 $93$--$96\%$,并且单个线性读出在 32k 样本处达到 $97.9\%$ 一致性,在结构化残差尾部中留下 $\approx1.1$--$1.2$ 困惑度差距。在保守的保留门下,在显式诊断监视器下的去噪步骤中,裕度规则提前大约 $17$-$28\%$ 退出。对 LangFlow、BitstreamDiffusion 和连续潜在扩散语言模型 (Cola-DLM) 的边界检查表明,当状态对象和解码器发生变化时,相同的接口问题仍然有意义。因此,连续和潜在扩散语言模型应该被评估为表示解码器系统。