论文
并非所有解释都同样模拟:比较语言化特征归因和自我生成的基本原理
Not All Explanations Simulate Equally: Comparing Verbalized Feature Attributions and Self-Generated Rationales
摘要
自然语言解释通常被视为理解模型行为的统一接口,但不同的解释源可能以不同的方式支持模拟。本文比较了问答模型的两种解释:言语特征归因和自我生成的基本原理。我们在共享的反事实模拟设置下评估它们,使用 LLM 判断器作为预测器,并测量它在给出解释时是否可以更好地预测模型对后续问题的答案。在多个指令调整模型中,我们分析了解释源、语言化策略和特征粒度如何影响解释的可模拟性。我们的结果表明,解释格式和粒度会影响可模拟性:基于归因的解释和自行生成的基本原理在改善反事实预测的程度上有所不同,其效果因模型和格式而异。