论文

使用自然语言自动编码器探测 Qwen2.5-7B 中潜在的哥伦比亚身份推断

Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders

模型评测模型行为与机制分析

摘要

大语言模型 可以从微妙的语言线索推断人口统计属性,即使这些属性没有明确说明。该试点研究检验了在处理哥伦比亚语-西班牙语和英语提示时,Qwen2.5-7B-Instruct 在内部是否代表哥伦比亚身份、社会经济地位或刻板印象相关信息。我们使用自然语言自动编码器 (NLA) 来描述每个提示的四个位置四分位数中第 20 层的残余流激活。我们的数据集包含 30 个提示,排列为 15 个匹配的西班牙语-英语对,涵盖显式哥伦比亚语提示、隐式哥伦比亚语提示和中性控件。我们报告描述性比率和定性证据,而不是统计动力效应,重点关注潜在国籍或刻板印象表征是否出现在模型输出中被语言化之前。这项工作将激活水平的可解释性与代表性不足的西班牙品种的偏差评估联系起来。