论文
文化意识被再现但未被解码:追踪 18 个开源 LLM 中的神话知识
Cultural Awareness is Represented but Not Decoded: Tracing Mythological Knowledge across 18 Open-Source LLMs
摘要
开源 LLM 可靠地命名了宙斯、木星和托尔,但在芬兰、斯拉夫、埃及或中国神话等较少代表性的传统中恢复了它们的对应物,其一致性要差得多。我们要问的是,这种文化默认是在模型内部的什么地方产生的。在 Thompson-motif 实体的并行跨文化基底上,我们使用线性探测、logits 透镜、激活修补和输出提取来检测来自 8 个架构系列的 18 个开源 LLM。残余流清楚地区分文化,远高于名称字符串基线,但解码器将文化特定的标记折叠到主导传统的标记上。失败在于读出,而不在于表示。用目标文化的母语和英语问同样的问题会产生在语言内聚集但在语言之间解耦的失败:解码器受到提示语言的限制。我们发布了每个实体(探针、输出)分解框架、引用锚定的跨文化 真值、针对语言条件读出的内部与跨模式相关性测试以及所有 18 个模型的每个实体预测。