论文
与什么相比?反事实提示的基线和指标
Compared to What? Baselines and Metrics for Counterfactual Prompting
摘要
反事实提示(即干扰单个因素并测量输出变化)被广泛用于评估 LLM 偏差和 CoT 忠实性 等事物。但在这项工作中,我们认为,如果不考虑对建立一般模型敏感性的文本的基线“意义保留”修改,则观察到的效果不能归因于目标因素。这是因为每一次反事实编辑都是一种复合处理,将感兴趣的变量与附带的表面形态变化捆绑在一起;这违反了治疗变异无关性。当我们通过手术改变患者性别时,我们观察到 MedQA 的预测翻转率为 14.9%。然而,从统计上看,这与简单解释输入引起的翻转率 (14.1%) 没有什么区别。因此,在这种情况下,得出 LLM 对患者性别特别敏感的结论是没有根据的。为了解释这一点并强有力地衡量有针对性的干预措施的效果,我们提出了一个框架,在该框架中我们比较(通过统计测试)在目标干预下观察到的差异与由释义输入引起的差异。然后,我们使用该框架重新审视对 MedPerturb 数据集进行的分析,该数据集报告了模型对患者人口统计数据和风格线索敏感的证据。我们发现,当我们考虑一般模型敏感性时,这些影响很大程度上消失了,120 项测试中只有 5 项达到统计显着性。将相同的框架应用于职业传记分类,我们发现明显显着的方向性性别偏见,表明该框架识别出真正的方向性影响,即使它们很小。我们评估了一系列指标(聚合、每个样本的分布和回归),发现每个样本的指标比聚合指标更强大,而回归则有力且独特地表征了效应方向和幅度。