论文
理解扩散中的评估错觉 大语言模型
Understanding Evaluation Illusion in Diffusion Large Language Models
摘要
尽管具有并行解码的能力,但扩散 大语言模型 (dLLM) 需要许多去噪步骤来维持生成质量,这激发了最近对高效解码策略的研究。然而,即使在看似相同的评估设置下,现有研究也报告了不一致的评估结果,存在关于 dLLM 解码方法的有偏见的结论的风险。为了理解这个评估问题,我们在不同的评估设置中对 dLLM 的当前解码方法进行了严格的评估。令人惊讶的是,我们的分析表明解码方法的排名对提示模板的选择高度敏感。单模板评估可能会导致一种错觉,即解码方法可以提高推理效率而不会降低性能。通过全面的实验,我们发现当前的并行解码方法始终低于单词元解码基线,未能克服速度与质量的权衡。我们进一步将这种评估不一致确定为并行解码方法对提示模板中的微小变化的高度敏感性。我们的实验表明,即使使用较少的去噪步骤,有效的提示模板也可以取得很好的评估结果,明显优于增加去噪步骤所带来的边际增益。除了提示模板之外,我们的实验表明,被忽视的评估设置也会显着影响解码方法的评估。基于这些发现,我们提出了可靠评估 dLLM 解码方法的实用指南。