论文
DiffScore:超越自回归可能性的文本评估
DiffScore: Text Evaluation Beyond Autoregressive Likelihood
摘要
自回归语言模型广泛用于文本评估,然而,它们从左到右的分解引入了位置偏差,即早期标记仅使用左侧上下文进行评分,将架构不对称性与真实文本质量混为一谈。我们提出掩模重建作为替代范例,其中每个标记都使用完整的双向上下文进行评分。我们介绍 DiffScore,一个基于 Masked Large Diffusion Language Models 构建的评估框架。通过测量连续屏蔽率下的文本可恢复性,DiffScore 消除了位置偏差,并自然地建立了从局部流畅性到全局连贯性的评估层次结构。我们还提供自回归框架无法使用的诊断工具:多时间步质量配置文件,可分解不同掩蔽率的分数,以及双向 PMI 分解,可将流畅性与 忠实性 分开。十个基准测试的实验表明,DiffScore 在零样本和微调设置中始终优于自回归基线。代码发布于:https://github.com/wenlai-lavine/DiffScore。