论文
知道,并且只在被问到时才说:大语言模型内诊断学和 Minerva-7B 的精神分裂症
Knowing, and Saying It Only When Asked: LLM Endognostics and the Schizognosis of Minerva-7B
摘要
通过阅读其答案来评估对齐的语言模型假设答案具有评估者关心的区别。我们引入了 LLM 内观学,这是一种白盒内部审计框架,旨在提取和因果操作残留流中的潜在知识。将 Minerva-7B-Instruct-v1.0 应用于超过 12 个专业风险类别的 124 个最小提示对时,大多数集合的行为评估都失败:该模型对 63.7% 的对(95% CI [55.0%, 71.6%])表现相同,遵守或拒绝两个成员。然而,通过雅可比透镜将残差流投影到词汇上,揭示了统计学上显着的对比内观裕度,证明该模型在内部保持了强大的风险区分。在跨越 25 个事实和 5 个语言框架的第二个协议中,我们表明该模型在 72% 的情况下符合预设的谎言,尽管在其潜在层中代表了真实的实体。通过手术消除植入的谎言的方向,在 25 个被抑制的案例中,有 11 个恢复了正确答案 (McNemar p = 0.0010),并通过盲人注释进行了验证(二进制一致性 kappa = 0.68)。相比之下,样本外线性探针在第 10 层实现了 77% 的准确度,但其正交消融产生了 0% 的恢复率。这建立了一个基本的理论分离:抽象的线性表示并不意味着对言语的因果控制。我们的主要贡献是内诊学的形式化,以证明行为评估和内部解读在常见情况下系统地不一致,并且线性可解码性与因果控制脱钩。