论文

SOL:通过双切片 Wasserstein 指标测量文本分布之间的差距

SOL: Measuring Gaps between Text Distributions by Double Sliced Wasserstein Metrics

模型评测评测方法与指标

摘要

评估文本生成需要测量生成的分布与数据分布的匹配程度。对于自回归模型,这是通过困惑度来完成的。基于扩散和流的语言模型只能提供似然界限,其紧密度在模型系列之间有所不同。基于样本的替代品(例如熵的生成困惑)不考虑分布拟合。我们提出 SOL,文本分布之间的距离。每个序列都由其隐藏状态在固定变压器下的经验测量来表示,并且这些测量的分布通过双切片 Wasserstein 距离进行比较。我们证明如果变压器是单射的,SOL 是一个度量。实验表明,SOL 可以检测分布故障、恢复预期模型趋势并提供稳定的基于样本的估计。我们提出 SOL 来填补当前用于非自回归模型的评估协议的空白。第一步,我们使用 SOL 重新评估在 OpenWebText 上训练的各种模型。

SOL:通过双切片 Wasserstein 指标测量文本分布之间的差距的原论文方法或结果图
图 2:对于固定扩散语言模型和数据集,报告的 MAUVE 分数取决于评估样本 $n$ 和集群 $K$ 的数量。特别是,对于标准选择 $K=n/10$(红色框),即使在 5k 样本之后也不稳定。生成详细信息在附录 E.2.2 中给出。