论文
开放式文本生成的连贯性感知分布评估
Coherence-Aware Distributional Evaluation of Open-Ended Text Generation
摘要
开放式文本生成的现有指标衡量通用表示空间中的可能性、词汇多样性或分布相似性,但它们可能会错过质量的基本维度。一个突出的盲点是全局连贯性:生成的段落可能局部流畅,但同时保持全局矛盾、因果不一致或局部脱节。此类失败仍然可以保留现有指标所依赖的标记级别和词法统计信息。我们将表示确定为检测这些故障的中心瓶颈,并引入了 CHORD(相干性感知隐藏状态开放生成参考距离),这是一种相干性敏感的分布度量。 CHORD 使用连贯性引发提示对冻结 LLM 的隐藏状态空间中生成的和人工编写的语料库进行编码,并使用 MMD 与 RBF 内核比较结果分布。为了验证该指标响应连贯性下降而不是一般文本变化,我们构建了一个反事实评估套件,将分级连贯性下降扰动与意义保留控制配对。 CHORD 有选择地检测关系、话语、结构和混合失败,这些失败包括困惑、熵、MAUVE、FBD 和基于 MMD 的基线,这些失败要么错过,要么无法与良性重写分开。阶乘消融表明表征是相干敏感性的主要来源,而一旦相关区别变得可见,RBF-MMD 就会提高样本效率。较大的主干可以捕获更细粒度的区别,但只有当主干可以遵循 http://prompt.On 无条件生成和前缀延续时,一致性提示才能提高选择性,CHORD 生成的模型排名与人类对输出是否有意义的判断高度一致,并且看起来是人类编写的。总之,这些结果确立了表示设计作为可靠分布评估的核心。