论文
生成前沿:为什么评估对于扩散语言模型很重要
Generative Frontiers: Why Evaluation Matters for Diffusion Language Models
摘要
扩散语言模型最近取得了令人兴奋的进展,在生成轨迹方面比自回归模型提供了更大的灵活性。这种灵活性促使越来越多的研究机构开始研究扩散语言建模的新方法,这些方法通常从 GPT-2 小规模(1.5 亿个参数)开始。然而,这些进步给评估方法带来了新的问题。在本技术说明中,我们讨论了当前方法的局限性,并提出了原则性的增强措施,以确保可靠的比较。我们首先讨论为什么 OpenWebText 已成为标准基准,以及为什么 LM1B 等替代方案本质上意义不大。然后,我们讨论扩散模型的似然评估的局限性,并解释为什么单独依赖生成困惑度作为度量可能会导致无信息的结果。为了解决这个问题,我们证明生成困惑度和熵是 KL 散度与参考分布的两个组成部分。这种分解解释了生成困惑对熵的敏感性,并自然地建议生成边界作为评估模型生成质量的原则方法。我们对这个规模的模型质量进行了实证观察。我们在 https://patrickpynadath1.github.io/blog/eval_methodology/ 上发表了一篇带有交互式内容的博客文章来说明这一论点。