论文
解释多重性:电路级可解释性证据经不起合理分析设定的变化
Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation
摘要
欧盟AI法案要求高风险系统的提供方提交描述系统如何达成决策的技术文档。机制可解释性是此类证据的显然来源,而电路发现是其最成熟的工具。我们要问的是:这种证据能否经受住它被依赖时所处的条件——两名胜任的分析师、同一个系统、同一套工具、不同但都合理的设定。我们预注册了一个跨越七个分析轴的交叉网格,每个水平都取自已发表的实现,并将每个发现的电路通过确定性的声明映射为结构化的附件IV(Annex IV)陈述。在GPT-2小模型与间接宾语识别任务上共15,840个预注册设定中,7,561个产生了声明;导出的陈述在73.2%的设定对之间翻转(95% CI 0.725至0.738),而众数声明仅占据41.1%的空间。在合格评定机构可能接受的任何容忍度下,该证据都未通过可提交性(filability)标准。仅标准化最具影响力的单一选择——评估指标——翻转率仍为59.4%。将电路规模从声明中完全移除并加以固定,仍有27.1%(95% CI 0.255至0.286),仍高于预注册阈值。支撑这些声明的电路在结构上近乎不相交(成对Jaccard重叠中位数4%),功能上不相关(Cohen's kappa 0.015),因此这种不稳定并非同一机制的不同表述。我们给出可提交性标准作为独立协议,并报告七个记录在案的发现目标之一在该库自身的规范任务上根本无法运行。该研究只覆盖一个模型和一个任务,结论是否在大规模上成立未经检验。
