论文
精确率不等于忠实性:用完整参考标准衡量基于证据生成的事实覆盖
Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle
摘要
无参考忠实性指标逐项核查模型的陈述是否符合事实,但往往只衡量精确率,因而可能奖励弃答:几乎什么都不说也能取得高分。研究利用F1赛事遥测,在每项决策相关事实均能被完整、确定推导的场景中,同时精确测量事实召回率。在涵盖157场比赛、7,253个决策实例的英西葡多语言基准上,精确率最高的前沿模型覆盖不到一半的相关事实,F1排名最后;类似现象在NOAA天气预报中再次出现。使用完整参考事实微调1B–7B小模型,使F1达到约0.98,优于所有零样本前沿系统。研究把忠实性与覆盖率结合为一个分数,通过受控扰动及正则表达式与跨模型提取器的一致性验证指标,并提出无需参考答案、由验证器引导的生成方法来同时改善精确率与召回率。作者发布了基准、标注、指标、基线和交互演示。