论文

更快但不同:诊断和控制加速多模态扩散语言模型中的内容漂移

Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models

模型评测模型行为与机制分析

摘要

无需训练 加速使基于扩散的多模态 大语言模型 (dMLLM) 更具可部署性,但它可能会默默地改变生成的内容。我们在 300 个真实图像上研究了服务时间一致性问题,将 Fast-dLLM 输出与同一模型的未加速输出进行比较。在我们的长格式设置中引入的轻度并行性(每步 1.05--1.25 个提交词元)中,置信度阈值调整会改变解码行为,但不会改变基线一致性。相反,状态刷新消融和图像交换干预将陈旧的视觉和生成的文本状态识别为漂移的贡献者。对于测试的 Fast-dLLM 实现,缩短 KV 缓存刷新间隔会产生单调速度——协议边界,并且在测得的 1.3 倍加速下接近精确协议。 dLLM-Cache 和 LaViDa 也出现了初步诊断,尽管 dLLM-Cache 仅在两个缓存都收紧后才恢复一致,这消除了其速度优势。独立的提示和图像再现了阈值不敏感和刷新恢复。有针对性的审计发现 50 个低一致性对中有一半存在真实内容替代。在单独的双盲双注释评估中,合并的加速减去基线事实误差差异为 0.00 (95% CI [-0.17,+0.17]);该样本没有检测到差异,但未建立事实等同性。最后,所测试的自适应或平滑刷新变体都没有在匹配计算时击败固定间隔。我们的贡献是配对诊断和实施范围的一致性控制,而不是准确性或安全性保证。