论文

RiDiC 的编年史:生成具有受控流行度分布的数据集以进行长篇事实性评估

The Chronicles of RiDiC: Generating Datasets with Controlled Popularity Distribution for Long-form Factuality Evaluation

模型评测基准与评测资源

摘要

我们提出了一个可配置的管道,用于使用维基百科和维基数据的数据生成具有指定特征(例如域、地理位置和流行度)的多语言实体集。这些数据集旨在评估 LLM 长格式生成的真实性,从而补充基于短格式 QA 数据集的评估。我们将 RiDiC 数据集作为此方法的示例。 RiDiC 包含来自三个领域(河流、自然灾害和汽车模型)的 3,000 个实体,跨越不同的受欢迎程度。每个实体都附有其地理位置、英文和中文名称(如果有)以及相关英文和中文维基百科内容,用于评估 LLM 的响应。从三个英文和中文的LLM中获得了有关RiDiC实体的代数。然后使用第三方事实检查器对这些进行评估,结果表明我们数据集中的实体甚至导致前沿模型产生幻觉。为了方便评估 LLM 的多语言长格式真实性,代码、数据和生成/评估脚本已发布。