论文
审计规则如何塑造大语言模型的忠实因素解释
How the Audit Rule Shapes Faithful Factor Explanations in LLMs
摘要
大语言模型经常被问到哪些输入因素影响了它们的输出。对于结构化输入,可以通过反事实扰动来检查此类报告,但每个因素必须多次查询才能估计其效果,因此验证通常受到预算限制。我们研究这种有限的预算设置如何改变如实报告因素级影响的动机。我们将交互形式化为验证游戏,并表明当审计依赖于报告时,仅适当的评分是不够的:依赖于报告的审计会产生抑制激励,因为报告为重要的因素更有可能因估计噪音而受到检查和惩罚。相比之下,独立于报告的审计,或者具有较小的独立于报告的下限的混合规则,消除了这一渠道,并使真实报告比全面压制更可取。我们使用 Counterfactual Brier Score (CBS) 实例化该框架,并在四个 NLP 基准上评估其预测。合成理性Agent与理论预测完全匹配,而真正的大语言模型在明确时遵循相同的激励措施。主要设计含义很简单:在部分验证下,因素级解释系统应包括与报告无关的审计组件,以便不能利用少报来逃避审查。