论文

扩散 MLLM 中的两个时钟:当答案在基本原理展开之前稳定下来时

Two Clocks in Diffusion MLLMs: When Answers Stabilize Before Rationales Unfold

模型评测模型行为与机制分析

摘要

掩蔽扩散 MLLM 中的候选答案可以稳定下来,而其基本原理仍在展开。我们将记录的候选者的回顾性稳定性与词元承诺区分开来,并检查这两个时钟相对于基本原理生成的情况。通过分析三个视觉问答基准的结果,我们发现在单块、EOS 抑制的 LaViDa 运行中,89.4-98.1% 的理性侧画布在稳定状态下仍未写入。在 V*Bench 上,将块长度从 128 减少到 8,将该比例从 89.4% 更改为 1.7%,同时还包括答案覆盖率和合格的观察窗口。在支持 EOS 的提示下,直接指令将 Nemotron 在 M3CoT 和 ScienceQA 上的整体准确度提高了 15.0 和 19.5 个百分点,但将 LaViDa/V*Bench 准确度降低了 11.0 个百分点。对称分解将每个变化的较大绝对分量与覆盖范围而不是条件精度相关联。匹配画布图像消融可测量视觉灵敏度和答案稳定性,从而分离两个时间读数。这些测量结果共同区分了答案稳定性、基本原理展开和视觉敏感性,并将覆盖范围确定为提示差异的较大组成部分。