论文

TriQua:事实性评估中的粒度与上下文协调

TriQua: Reconciling Granularity and Context in Factuality Evaluation

模型评测评测方法与指标

摘要

"分解-验证"框架在LLM事实性评估中面临一个根本性的权衡:原子事实,即一句话传达一个单位的信息,常常忽略必要的上下文;而宽泛的陈述缺乏精确评估所需的粒度。为解决这一问题,我们引入TriQua,这是一个能够灵活地基于其复杂性来建模事实的框架。简单的声明被提取成标准三元组,而复杂的声明则通过附加辅助性的上下文限定词来表示为超关系的事实。这种适应性的结构保留了准确检索和验证所必需的必要上下文,而不牺牲原子性。此外,TriQua的验证过程直接标注在具体的三元组和限定词中,提供细粒度的可解释性以检测错误。同时,我们还提出了TriQuaScore来量化这些结构化的事实单元的事实性。实验结果表明,TriQuaScore与人类标注的事实性评分高度一致,TriQua实现了强大的分解质量,并在基于证据的事实验证方面超过了现有的基于分解的框架。