论文

忠实性 指标无法衡量 忠实性:使用 真值 进行元评估

Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth

模型评测评测方法与指标

摘要

思想链 (CoT) 已成为解释和审核 大语言模型 行为的核心。然而,越来越多的证据表明,这些痕迹往往无法忠实地代表模型预测背后的计算。已经提出了几个 忠实性 指标,但它们是否确实衡量 忠实性 仍然未知。回答这个问题需要 真值 标签,但由于内部计算无法直接观察,因此很难获得这些标签。因此,大多数提出指标的工作仅报告绝对分数或与先前指标的比较,并且少数现有基准依赖于合理性或重要性等代理,以及与 忠实性 正交的属性,这些代理可能会误导 CoT 是否可信。我们通过构建任务来应对这一挑战,其输出揭示了哪些中间计算必须产生它们,并开发一个自动标记管道,在步骤和 CoT 级别生成 真值 忠实性 标签。在此方法的基础上,我们提出了 BonaFide,这是一个涵盖 13 个任务和 10 个模型的 3,066 个标记 CoT 的基准,并使用它对重要的 忠实性 指标进行首次系统评估。我们的实验表明,大多数指标的表现接近偶然,表现出强烈的预测偏差,并且在较长的 CoT 上性能会下降。最佳指标在 CoT 级别仅达到 0.70 AUROC,而另一个指标在步骤级别达到 0.59,两者都没有跨设置转移,同时需要极高的计算成本。我们的结果暴露了当前 忠实性 评估的根本差距,并呼吁开发更可靠、更高效的指标。