论文

开放式文本生成中的连贯性和多样性的基于参考的分析

Reference-Based Analysis of Coherence and Diversity in Open-Ended Text Generation

模型评测评测方法与指标

摘要

评估开放式文本生成涉及了解延续的不同属性与其感知质量的关系。我们提出了一个基于参考的框架,通过三个角度来检查一致性和多样性:将它们的进化与人类轨迹保持一致,将它们的摘要与相同提示的人类延续进行比较,以及估计它们在人类参考分布下的可能性。人类质量评级的实验表明,基于多样性的对齐和基于平均值的比较捕获了质量相关的变化,尽管这些比较并没有建立时间对齐相对于更简单基线的预测优势。参考可能性还显示出与评级的正相关性,结果因参考配置和评分范围而异。总之,这些分析提供了一种结构化的方法来检查测量的一致性和多样性如何与人类判断相关,同时区分与人类参考的相似性和质量本身。此 https URL 提供了代码和分析资源。