论文

这会改变你的答案吗?通过反事实实验评估 LLM 野外行为的解释

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

模型评测评测方法与指标

摘要

人工智能研究的许多领域,例如语言模型可解释性和思想链 忠实性,都试图解释模型行为。但什么才是“好的”解释呢?在这项工作中,我们通过反事实可模拟性的角度来评估解释——该解释是否有助于预测相关反事实输入的模型行为。为此,我们引入了 CHIVE(通过编辑进行反事实假设调查),这是一种新颖的代理管道,可以识别野外的意外模型行为,并通过反事实提示编辑来研究它们。这为自然发生的模型行为提供了数千种高质量的解释,并提供了反事实证据。我们以两种方式应用CHIVE。首先,我们评估常见的 LLM 可解释性技术是否可以提高代理预测反事实模型行为的能力。令人惊讶的是,我们发现所研究的任何可解释性技术都没有带来任何提升。其次,我们使用 CHIVE 生成训练数据。我们发现,预测 CHIVE 生成的反事实实验结果的训练模型可以推广到各种分布外设置。总体而言,CHIVE 自动发现自然发生的 LLM 行为的解释,使我们能够评估和改进解释 LLM 行为的方法。