论文

不确定但确定:揭示扩散语言模型中的表示-置信差距

Unsure but Certain: Uncovering the Representation-Confidence Gap in Diffusion Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

扩散语言模型使用广泛的上下文来创建文本,这表明它们可能比标准模型更好地处理输入噪声。测试表明这只是部分正确。在内部,扩散模型可以高度准确地检测文本错误。从外部来看,他们报告的确定性忽略了这一信号。由于噪声导致准确性下降,置信度保持在最大值附近,并且正确对答案进行排名的能力会降低到随机机会。我们将这种不匹配称为表示置信度差距。高确定性分数的可见集中是一种误导性的表面症状。标准数学调整消除了这种集中,但未能修复排名顺序的潜在损失。这种排名缺陷有利于噪声条件下的标准模型,并且抵制常见的补救措施。匹配训练可以恢复准确性,但不能恢复排名,而分数重新校准和输入级别错误信号无法对最终答案进行重新排序。然而,正确评估答案所需的信息仍然存在于隐藏状态中。轻量级提取工具使用此信号来提高排名。这种方法非常高效,因为它使基本模型完全冻结并且需要零额外的文本生成步骤。我们提出这个工具来证明信号存在,同时清楚地指出其局限性。最终,确定性可靠性是比噪声条件下的总体精度更紧迫的限制。