论文
检查你的LLM的秘密词典!五行代码揭示了您的 LLM 学到了什么(包括它不应该学到的)
Check Your LLM's Secret Dictionary! Five Lines of Code Reveal What Your LLM Learned (Including What It Shouldn't Have)
摘要
我们展示了基于 Transformer 的 大语言模型 的 lm_head} 权重矩阵的奇异值分解(仅需要五行 PyTorch 并且不需要模型推理)直接从模型权重揭示可解释的语义子空间。每个左奇异向量标识当隐藏状态与相应的奇异方向对齐时最容易选择的词汇标记;检查这些集群可以揭示模型的训练数据组成和管理理念。分析 GPT-OSS-120B、Gemma-2-2B 和 Qwen2.5-1.5B,我们发现不同模型的奇异值谱和词汇簇结构存在系统性差异:GPT 表现出功能区分子空间的分级层次结构; Gemma以十九世纪前的英语正字法为主,形成阶梯式聚类结构,可能有助于高输出可控性;和 Qwen 展示了广泛的多语言覆盖范围以及作者认为在道德上不适合直接出版的子空间。基础指令比较表明,伦理上相关的子空间起源于预训练,并且不会被 后训练 对齐删除。我们引入词汇聚类得分(VCS)来量化子空间一致性,并引入加权投影得分(WPS)作为静态故障标记检测器;将 WPS 应用于 GPT-OSS-120B 可以恢复 shokubutsu-hyakka-tsu (ID 137606),这是 CJK 语言社区中广泛报道的一个众所周知的故障标记,无需任何模型推理。我们提出了对有问题的词汇内容的根本原因进行分类,并呼吁采用 lm_head} SVD 分析作为标准的预发布安全审核步骤。我们的研究结果进一步表明了 SVD 引导的分词器优化和更可控的 LLM 设计的方向。