论文
具有战略注释的以人为锚定的事实性评估
Human-Anchored Factuality Evaluation with Strategic Annotation
摘要
基于 LLM 的事实性判断提供了可扩展的评估信号,但他们的指标相对于人类判断往往存在系统性偏差。我们在有限的注释预算下研究以人类为锚定的事实性评估,其中对完整数据集的判断预测与小选择性采样子集上的人类标签相结合,以获得统计上有效的估计。这种方法的效率关键取决于哪些例子接受人工注释:在事实性评估中,法官与人类的不一致不仅仅由低置信度驱动,而且还由结构性故障模式驱动,例如证据不完整、时间不匹配、无法验证的主张和标题不一致。为了利用这种结构,我们引入了一种特定于事实的注释策略设计管道,该管道使用故障空间分析(FSA)来导出各种预测信号,以对人类判断不一致进行建模。在基于内部参考的事实评估系统 (AutoFA) 和 RAGTruth 上,法官预测的估计大大低估了人类注释的事实准确性,我们的 FSA 指导政策提高了统一采样和不确定性驱动基线的注释效率,在 AutoFA 上实现了 40.3% 的有效样本量增益,在 RAGTruth 上实现了 27.1% 的有效样本量增益。