论文

语言模型隐藏状态中的国籍编码:探索角色条件学术文本中的文化差异表征

Nationality encoding in language model hidden states: Probing culturally differentiated representations in persona-conditioned academic text

模型评测模型行为与机制分析

摘要

大语言模型 越来越多地用作学术英语写作工具和教学资源,但目前尚不清楚它们在生成学术文本时是否编码了文化差异的表示。本研究测试了 Gemma-3-4b-it 在生成以英国和中国学术角色为条件的研究文章介绍时是否在隐藏状态中编码国籍歧视信息。 270 条文本的语料库是由 45 个提示模板生成的,这些提示模板与 2 x 3 设计中的 6 个角色条件交叉。逻辑回归探针在所有 35 层的隐藏状态激活上进行训练,并使用洗牌标签基线、表面文本天际线分类器、跨家庭测试和句子级基线作为对照。使用 Stanza NLP 管道对探针选择的标记位置进行结构、词汇和立场特征的注释。国籍探测在第 18 层达到了 0.968 的交叉验证精度,并具有完美的保留分类。国籍编码遵循跨层非单调轨迹,结构效应在中上层网络中最强,词汇域效应更早达到峰值。在高信号标记位置,与英国相关的模式显示出更多的后修饰、对冲、提升、被动语态和评价性或面向过程的词汇,而与中文相关的模式则显示出更多的前修饰、名词谓词和社会文化或国际化词汇。然而,句子级分析发现完整生成的表面文本没有显着的国籍差异。研究结果将探究方法扩展到社会语言学属性,并对 EAP 和语言教育学具有实际意义。