论文
线性偏置探头何时以及为何会失效?大型语言模型表示中偏差可检测性的几何和统计理论
When and Why Do Linear Bias Probes Fail? A Geometric and Statistical Theory of Bias Detectability in Large Language Model Representations
摘要
线性探测是检测大型语言模型隐藏表示中的社会偏见的标准工具。然而,报告的探测准确性几乎完全来自\emph{反事实}评估,其中每个输入都带有明确的人口统计标记。一旦输入的一小部分 $\alpha$ 携带人口统计信息,性能就会急剧下降,并且弱探针可能反映了无偏模型或动力不足的检测器。我们开发了一种理论来解决这种模糊性。将表示建模为在曲率流形 $\kap$ 上具有马哈拉诺比斯分离 $s$ 的两个类条件簇,我们证明: (i) 由流形外在半径控制的有限样本泛化边界,具有匹配的 $\smash{\sqrt{\dB/n}}$ minimax 下界; (ii) 最大线性探针 AUC 的精确纯度定律,严格按 $\alpha$ 递增; (iii) 曲率上限:空间形式上的环境弦分离不能超过 $2/\sqrt{\kap}$; (iv) 可检测性阈值,低于该阈值,任何审计都无法区分探测输出和偶然输出。每个定理都在具有已知基本事实的合成流形和六个开放权模型 $\times$ 四个偏差维度上进行验证,其中纯度定律从在 $\alpha=1$ 测量的单个交叉拟合 $\hat s$ 预测整个 AUC--$\alpha$ 曲线,没有参数拟合到这些曲线。该框架将偏差审计转变为功效分析:给定目标纯度和效果大小,它规定了结论性审计的样本预算 $n(\alpha)$。