论文

语言模型中的分级实体熟悉度读数:波兰语适应、跨语言鲁棒性和拒绝指导

Graded Entity-Familiarity Readouts in Language Models: Polish Adaptation, Cross-Language Robustness, and Refusal Steering

模型评测模型行为与机制分析

摘要

语言模型能否在生成答案之前估计其对实体的熟悉程度?我们使用涵盖四个领域和十个维基百科页面视图十分位数的 1,440 个波兰实体的新数据集以及伪造的控件,研究了来自 Bielik、PLLuM、Gemma-4 和 Qwen3 系列的 12 个指令调整模型中最终提示标记的激活。熟悉度调查分数将每个家庭中真实的实体与虚构的实体区分开来;在波兰语适应的 Bielik 和 PLLuM 家族中,他们还跟踪实体流行度(模型均值 Spearman $ρ$ 0.28-0.57,而 Gemma-4 和 Qwen3 中最多为 0.11),这种模式与波兰语适应的相关性比该模型样本中的参数计数更密切。在对两个家族进行的配对实验中,当波兰语问题词干被围绕未更改的实体名称的英语问题词干替换时,探针保留了 96-101% 的语言内 AUROC,这表明在此设置中对提示语言的鲁棒性。在 Gemma-4-12B 中,唯一一个本身拒绝的模型,在单层添加一维熟悉度方向会在两个方向上单调移动拒绝率(知名实体上为 0.24 到 1.00;未知实体上为 0.73 到 0.00)。最后,尽管后代检测器平均可以更好地预测行为错误,但经过校准的熟悉度探针在前代弃权门中具有竞争力。这些结果支持分级的预生成实体熟悉度读数,以及代表性熟悉度和将其转化为弃权的政策之间的分离。