论文

文本的保真度多样性指标

Fidelity-Diversity Metrics for Text

模型评测评测方法与指标

摘要

随着语言建模技术的成熟,人们越来越关注用于训练这些模型的数据集的组成和管理。例如,从业者通常寻求使用额外的文本来增强高质量的数据集,以增强基于该数据训练的模型的性能。然而,有关数据增强的明智决策需要对数据质量进行更细致的评估。我们在测量生成模型的精确度和召回率的基础上开发了一对指标,用于量化(1)保真度,捕获候选文本与参考数据的相似程度,以及(2)多样性,捕获它对参考数据集模式的覆盖程度。我们的指标基于离散文本摘要之间的最佳传输散度函数。在 M2D2 文本数据集的实验中,我们表明这些指标能够解决候选文本缺乏多样性和保真度缺乏的问题。在进一步的实验中,我们的指标检测合成 GSM8K 式数学数据集中的多样性缺陷,这与在此合成数据上微调的语言模型下游准确性的下降相关。