论文

CaRE:面向掩码扩散语言模型的计算感知重掩码评估协议

CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models

模型评测评测方法与指标

摘要

掩码扩散语言模型(MDLM)进展迅速,但可靠解读其进展所需的评估标准没有跟上。尽管MDLM已能与自回归语言模型竞争,近期七篇重掩码论文却在互不兼容的设置下评估,改变名义步数、指标和采样温度而不联合控制这些因素,使其策略排名基本不可比,也让报告的增益究竟反映算法改进还是评估伪影悬而未决。我们提出CaRE,一个计算感知的评估框架,通过标准化实际函数评估次数(NFE)、强制多指标报告和显式控制随机性来审计MDLM重掩码策略。将CaRE应用于LLaDA-8B-Base和Dream-7B-Base上的7种重掩码策略,在OpenWebText和LM1B上取4个随机性水平和3个步数预算,CaRE揭示:(i)温度解释了MAUVE方差的大部分;(ii)计算匹配的比较逆转了若干已发表的策略排名;(iii)知情重掩码与随机解掩码存在张力,在256步、unmask_temp=0.25时高熵重掩码使MAUVE降低0.296(p=0.020)。一个覆盖12个开源权重MDLM(1.5亿到80亿参数)的CaRE排行榜显示,这一交互方向在不同架构和规模上都成立。这些发现表明,当前的MDLM评估可能系统性地将算法改进与隐藏的计算量和随机性选择混为一谈。我们发布评估协议、实现和排行榜,以确保未来的重掩码声明可复现、可比较。

CaRE:面向掩码扩散语言模型的计算感知重掩码评估协议:论文配图
图 1:评估差距:七篇 remasking 论文在不同条件下进行评估,产生矛盾的排名。三个混杂因素(计算、度量、随机性)各自独立地推翻结论。共同控制这三个因素揭示了它们的相互作用(p=0.020p{=}0.020;无 vs. high_entropy,LLaDA-8B-Base,OWT,256 步骤,t=0.25t{=}0.25,3 个种子,配对 tt 测试)。