论文
超越双向性承诺:重新评估扩散语言模型的鲁棒性
Beyond the Bidirectional Promise: Re-evaluating the Robustness of Diffusion Language Models
摘要
扩散语言模型(Diffusion Language Models, DLM)通过支持双向上下文与迭代精炼,为自回归(AR)生成提供了一种引人注目的替代方案。然而,它们在自然输入噪声与对抗攻击下的可靠性仍未得到充分探索。为此,我们利用两组参数匹配的模型对(LLaDA-8B对LLaMA-3-8B,以及Dream-7B对Qwen2.5-7B),在32种自然扰动条件、对抗梯度探测和机制性隐状态分析下,系统评估DLM相对于AR基线的鲁棒性与校准。这种配对设计有效地区分了架构固有属性与依赖权重的行为。我们发现了一幅细致的鲁棒性图景:高度随机的DLM损失地形天然抵抗基于梯度的对抗后缀,却对自然噪声没有保证性防御,证明日常鲁棒性取决于权重而非架构本身。此外,DLM表现出系统性过度自信,构成实际的部署风险。最关键的是,机制性探测显示所有模型都能完美编码输入损坏,从而把行为脆弱性完全定位于解码器路由失败。与这一诊断一致,我们表明表面化的提示修补无法带来优于噪声基线的改进。归根结底,DLM的鲁棒性无法靠打补丁获得,必须从根本上融入迭代解码循环。
