论文

为忠实性辩护的正面案例:LLM 自我解释有助于预测模型行为

A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior

模型评测评测方法与指标

摘要

LLM 自我解释常被呈现为 AI 监督的有前景工具,但其对模型真实推理过程的忠实性仍知之甚少。现有忠实性指标存在关键局限,通常依赖通过对抗性提示识别不忠实,或检测推理错误,这些方法忽视了解释的预测价值。我们提出标准化可模拟性增益(Normalized Simulatability Gain, NSG),一个通用且可扩展的指标,其核心思想是:忠实的解释应能让观察者掌握模型的决策标准,从而更好地预测模型在相关输入上的行为。我们在涵盖健康、商业与伦理等热门数据集的 7,000 个反事实样本上评估了 18 个前沿专有与开放权重模型,例如 Gemini 3、GPT-5.2 和 Claude 4.5。我们发现自我解释能大幅提升对模型行为的预测(11-37% NSG)。即使外部模型更强,自我解释所提供的预测信息仍多于外部模型生成的解释,这意味着一种来自自我知识、外部解释方法无法复制的优势。我们的方法还发现,各模型中有 5-15% 的自我解释严重误导。尽管存在缺陷,我们为自我解释给出了正面论证:它们编码的信息有助于预测模型行为。