论文

潜时钟:扩散语言模型中的潜时间建模

Subliminal Clocks: Latent Time Modelling in Diffusion Language Models

模型评测模型行为与机制分析

摘要

扩散语言模型(DLM)近期已涌现为自回归模型的有前景替代。与标准扩散方法不同——DLM不显式以时间步为条件——引出一个自然问题:这些模型是否在内部表示去噪进度——以及此类信息如何在下游被使用?本工作中——我们表明DLM确实在其残差流中编码与扩散时间步相关的潜在表示。我们发现该信号可跨层用探针可靠提取——表明去噪进度可从内部激活中解码。我们进一步证明沿与推断时间步关联的低维子空间转向模型——可系统性地调节其去噪进度概念——导致模型置信度与熵的可预测变化。最后——我们分析所识别表示的几何——表明其在激活空间中展现结构化、可解释的性质——并阐明此类信号如何被这些模型处理。

潜时钟:扩散语言模型中的潜时间建模:论文配图
图 2:MLP 探针恢复 τ\tau 信号。随着我们深入研究模型,R2\rm{R}^{2} 系数(越高越好)会降低,直至 MSE 几乎减少到 τ\tau 方差的一半。此外,[mask] 和非 [mask] 令牌似乎都携带此信息,获得类似的高系数。