论文

为什么当图像潜伏有效时,少步文本潜伏会失败?夏普分类读数中的不承诺

Why Do Few-Step Text Latents Fail When Image Latents Work? Non-Commitment at Sharp Categorical Readouts

模型评测模型行为与机制分析

摘要

确定性的少步生成在连续图像潜伏上成功,但在连续文本潜伏上崩溃为不连贯的文本,我们表明原因是几何性的,而不是训练或缩放缺陷:平滑的、规则性有限的确定性映射无法在清晰的分类读出之前解决离散分支选择,因此少步失败是由解码器清晰度决定的,而不是传输精度。在真实文本自动编码器的重叠机制中,我们证明(定理 3)后验均值终端步骤以决策边界周围 $O(s(t))$ 管中潜在质量的速率翻转标记。在已发布的检查点上测量的两项诊断,DABI(读出清晰度)和 CCI(分类承诺)表明,四个独立构建的连续文本解码器将边界对齐的扰动放大得远远超出了标准匹配的各向同性扰动(DABI 从 $5\times10^{2}$ 到 $>10^{5}$),而图像解码器的 DABI $\approx 1$。有两种机制逃脱了连续界限:分类承诺(尽管读数更清晰,自回归解码器仍然成功)和随机重新注入($K=4$ 处的确定性 ODE 在同一模型上给出 PPL 294 与 SDE 50)。在理想化的分离体系中,我们证明了匹配尖锐的传输定律,包括维度相图:一旦潜在维度为$Ω(\log M)$(并且在固定维度中为$M^{1/n}$),分离$M$模式所需的确定性刚度将随着$θ(\sqrt{\log M})$增长,深度$B$层次结构给出$\sqrt{B}$更小的每步峰值(定理5-7);共面积恒等式将它们与重叠管联系起来(定理 17)。结果是精度-深度-刚度的权衡:在确定性连续类内,成本是不可减少的,并且两者都超出了它的范围。