论文

作为传输的自注意力:对称谱诊断的局限性

Self-Attention as Transport: Limits of Symmetric Spectral Diagnostics

模型评测模型行为与机制分析

摘要

每个注意力头都定义了一个程度标准化的运输运营商,并且越来越多的诊断家族从其频谱中读取模型行为(其中包括幻觉)。我们询问此类诊断可以推断出什么,不能推断出什么。该算子正交地分成控制传输\emph{容量}的对称部分和编码\emph{方向}的反对称部分。我们证明了可识别性限制:每个转置不变谱诊断都是\emph{方向盲}(无法区分算子与其转置,因此对信息流的方向视而不见),转置稳定性界限通过不对称系数$G$限制任何Lipschitz诊断的转置敏感性。这限制了注意力算子的频谱诊断可以解决的问题(例如 LapEigvals 和 LLM-Check 的注意力频谱分支)。在幸存轴上,封闭形式的二分奇格景观显示统一的因果注意力服从 $n$ 独立的 \emph{temporal-cut} 层 $φ\ge 1/5$,而窗口注意力将其刺穿为 $O(w/n)$;下限是一个理想化的基准,而不是经验吸引子,低于它的真实头的比例本身就是一个经验上稳定的架构描述符。两轴诊断($φ$ 表示容量,$G$ 表示不对称幅度)产生可证伪的极性预测,在仅解码器、仅编码器和编码器-解码器模型(容量轴信号 0.62--0.84 LC-AUROC)的长度控制、强制评分评估下证实 \emph{in sign}:极性在 HaluEval 和 MedHallu 之间反转,尽管强度不对称,但方向与预测一致,每个政权校准的决策极性。