论文
挤压和释放:通过将隐藏的幻觉作为安全信号暴露出来
Squish and Release: Exposing Hidden Hallucinations by Making Them Surface as Safety Signals
摘要
当直接询问时,语言模型会检测到错误的前提,但会在对话压力下吸收它们,从而在已经识别出的错误的基础上产生权威的专业输出。这种故障(阶隙幻觉)对于输出检查来说是不可见的,因为错误迁移到安全电路的激活空间中,被抑制但未被擦除。我们引入了 Squish 和 Release (S&R),这是一种激活修补架构,具有两个组件:固定探测器主体(第 24-31 层,局部安全评估电路)和可交换探测器核心(控制感知方向的激活向量)。安全核心将模型从合规性转向检测;吸收核心将其逆转。我们使用 Order-Gap Benchmark 对 OLMo-2 7B 进行评估 - 跨 500 个域的 500 条链,全部手动评分。主要发现:级联崩溃几乎全部发生(O5 的合规性为 99.8%);探测器主体是二元且局部的(第 24-31 层偏移 93.6%,第 0-23 层贡献为零,p<10^-189);综合设计的核心释放了 76.6% 的折叠链;检测是更稳定的吸引子(83% 恢复 vs 58% 抑制);认知特异性得到确认(假前提核心发布 45.4%,真前提核心发布 0.0%)。其贡献在于框架——主体/核心架构、基准测试和核心工程方法——其设计与模型无关。