论文

别利克知道它不知道的事情吗?激活离散度将模型尺度上的实体熟悉度与事实可靠性分开

Does Bielik Know What It Doesn't Know? Activation Dispersion Separates Entity Familiarity from Factual Reliability Across Model Scale

模型评测模型行为与机制分析

摘要

大语言模型 对他们从未见过的实体产生最多的幻觉。我们询问在生成单个答案标记之前模型的激活是否背叛了实体熟悉度,以及该信号是否预测了答案的事实可靠性。在四个波兰 Bielik 模型(1.5B-11B 参数)上,我们探测了四个实体域(运动员、城市、作家、音乐家),每个域都有 42 个众所周知的实体、42 个模糊但真实的实体以及 42 个由一句话问题解决的虚构实体(每个模型 504 个提示)。针对 SwiGLU MLP 激活后的两个无监督、单前向色散测量、逆参与比和谱熵,在所有领域和尺度上与 AUROC 0.95-1.00 的制造实体分开已知;受监督的线性探针达到 0.99-1.00。两个清晰的选择感知排列下限约为 0.70-0.74(经验 p<=1e-3),在保留的层选择中幸存下来(0.93-0.99),并且坚持真实姓名(已知与模糊但真实:0.96-1.00)。信号跨实体类型传输(平均非对角 AUROC 0.92-0.99);匹配模板反事实表明,唯一的大下降是模板引起的,而不是实体类型的影响,并且信号在各个头部扩散。这种代表性信号已经达到了 1.5B 的上限,而行为事实可靠性急剧上升:在严格的判断下,1.5B、4.5B、7B 和 11B 模型完全正确地回答了 42 名已知运动员中的 0、2、10 和 19 名运动员。在已知实体中,将正确答案与幻觉答案分开要困难得多(探针 0.93;分散度并不比第一标记熵基线好)。五个样本的语义熵基线在 5 倍的推理成本下仅达到 0.71-0.83。尽管有这种内部意识,模型几乎从不放弃:对 2,520 个答案的审核发现 2 个拒绝和 1 个对冲。实体熟悉度和事实可靠性是不同尺度曲线上的不同现象。