论文
数据集级指标削弱非确定性:扩散语言模型中的细粒度非确定性评估
Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models
摘要
扩散语言模型 (DLM) 已成为 大语言模型 (LLM) 的一个有前途的范例,但 DLM 的非确定性行为仍然知之甚少。 LLM 现有的非确定性评估主要依赖于固定推理配置下的数据集级指标,对模型行为在运行和评估条件下如何变化的了解有限。在这项工作中,我们表明,数据集级指标通过聚合不同运行中的样本级预测质量,系统地减弱了扩散语言模型中的不确定性。因此,具有相似总体性能的配置可能会在各个输入上表现出截然不同的行为,从而导致细粒度的不稳定性和不同的错误模式无法表征。为了解决这一限制,我们根据一系列模型相关因素(包括引导尺度、扩散步骤和蒙特卡洛采样)以及批量大小、硬件和数值精度等系统相关因素的样本级预测差异,对非确定性进行细粒度评估。我们的分析表明,DLM 中的非确定性是普遍存在且结构化的,代码生成对因子级选择的敏感性明显高于问题回答。为了归因非确定性评估的来源,我们引入了因素方差归因(FVA),这是一种跨因素分析指标,可将观察到的非确定性分解为归因于不同评估因素设置的方差。我们的研究结果强调需要进行细粒度、因素感知的评估,以实现对扩散语言模型的可靠的非确定性评估。