论文
破解生成困惑:为什么无条件文本评估需要分布度量
Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics
摘要
基于扩散和连续流的语言模型已成为语言建模的主要非自回归替代方案。这两种范式的进展绝大多数都是通过生成困惑(gen-PPL)来跟踪的:在冻结自回归(AR)评分器(例如 gpt2-large)下样本的每个标记的负对数似然,通常与经验熵护栏配对以排除低熵崩溃。我们认为这个指标不合理。通过构建,gen-PPL 仅测量评分 AR 下的可预测性,而不是语法或语义连贯性 - 并且可预测但仍然低质量的序列集组合起来很大。为了使这一点具体化,我们构建了一套零参数、故意朴素的采样器,它们在 LM1B 和 OpenWebText 上以非简并熵实现了最先进的 gen-PPL,超越了最近发布的扩散和连续流模型,同时生成了结构不连贯的文本。我们推荐直接量化生成文本和参考文本之间的分布差异的评估套件,并使用这样的套件重新对最近的非自回归模型进行基准测试,以更忠实地恢复当前技术水平。