论文
DiffusionGemma 的透明度如何?
How Transparent is DiffusionGemma?
摘要
LLM 推理透明度对于理解模型决策、减少误用和错位以及调试令人惊讶的模型行为至关重要。然而,DiffusionGemma 在连续的潜在空间中执行大部分计算;这是否会使其推理变得不那么透明?我们通过将透明度分解为两个部分来研究这个问题:变量透明度,我们是否理解模型计算状态的中间快照;以及算法透明度,我们是否可以使用这些快照来重建模型达到其输出的过程。天真地说,DiffusionGemma 的变量透明度很差:它的不透明串行深度,即在可解释模型状态之间发生的串行计算量,乍一看似乎比相应的自回归 Gemma 4 模型高 28.6 倍。然而,我们表明我们可以通过可解释的词元瓶颈映射去噪步骤之间的信息流,而不会降低下游性能。将这些中间状态视为可解释的,可将不透明序列深度减少到 Gemma 4 的 1.1 倍。扩散模型的算法透明度比自回归模型更难,因为画布中的所有标记预测都可以在每个去噪步骤中发生变化,从而使模型能够在去噪过程中实现复杂的分布式算法。为了开始弥合这一差距,我们进行了一系列可解释性案例研究,揭示了新颖的扩散特定现象的初步证据,例如非时间推理、标记和序列涂抹以及中间上下文推理。最后,我们测试可监控性,这是透明度的一个关键应用,用于衡量模型输出是否对下游任务有用。我们发现 DiffusionGemma 与 Gemma 4 具有类似的可监控性。