论文

RSD:移动局部三角图以审计语言模型隐藏状态

RSD: Moving Local Triangular Charts for Auditing Language-Model Hidden States

模型评测模型行为与机制分析

摘要

我们研究关系语义分解(缩写为 RSD),作为语言模型隐藏状态的移动局部三角图审计。对于重复出现的一个目标单词,RSD 在层或标记时间 $t$ 上拟合共享的三锚隶属度图表 $S_t$。隐藏状态通道使用$X_t\approx S_tC_t$;不变读数 $M_t=S_tS_t^\top$ 是诱导出现的共同隶属关系,$R_t=X_t-S_tC_t$ 记录拟合根图在图外留下的内容。更广泛的联合审计对关系数据重用相同的隶属关系图,$A_t\approx S_tB_tS_t^\top$,例如注意力衍生的出现关系。当前的 GPT-2 证据是 $X$ 通道隐藏状态审计,其中 Word-in-Context 标签用作外部同义与不同义参考关系。在完整的 WiC 训练中,根图通过了 53 个合格目标词中的 16 个;这是审计覆盖率,而不是 GPT-2 任务准确性。词元时间和对级诊断显示了主要机制: \texttt{make} 和 \texttt{break} 在目标状态对齐,\texttt{drive} 和 \texttt{stay} 在小数量探索性案例中在正确的上下文后得到改善,而 \texttt{play} 仍然是局部根图故障,其最终的同义对并不接近并且具有较大的剩余差异。由此产生的声明是诊断性的:RSD 报告在根共同成员资格中可见的感知关系以及哪些故障成为剩余分支候选者或注意通道义务。