论文
语言模型如何处理分布外输入:双路径框架
How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework
摘要
最近针对 LLM 的白盒 OOD 检测方法(包括 CED、RAUQ 和 WildGuard 置信度评分)似乎有效,但我们表明它们在结构上受到序列长度 (|r| >= 0.61) 的干扰,并且在长度匹配评估下崩溃到近乎偶然。即使是原始注意力熵(头和层的平均 H(alpha))(我们为了完整性而包含的自然基线)也显示出相同的混淆。这种混淆源于注意力的 Theta(log T) 对输入长度的依赖。为了在去混杂后识别真正的 OOD 信号,我们提出了一个双路径框架:嵌入捕获文本的内容(对主题转移有效),而处理轨迹(跨层的隐藏状态演化)捕获模型如何处理输入。每个路径的相对能力随着词汇透明度谱而变化:嵌入方法在词汇独特的 OOD 上表现出色,而轨迹特征检测与普通文本共享词汇的隐蔽意图输入(0.721 平均 AUROC;越狱:0.850)。三个证据线支持该框架:(1)k-NN 和轨迹评分在 6 个任务中的交叉,其中每个路径在不同的 OOD 类型上获胜; (2) 每层分析显示第 0 层 k-NN 信号几乎完全是长度伪影(越狱:0.759 原始 -> 0.389 匹配)——处理从接近机会嵌入构建真正的 OOD 信号; (3) 电路归因显示,对抗性任务比语义任务更能吸引注意电路(p = 0.022;越狱补丁 p < 0.001),并具有部分跨模型复制。代码发布后发布。