论文
粒度轴:语言模型中社会角色的微-宏观潜在方向
The Granularity Axis: A Micro-to-Macro Latent Direction for Social Roles in Language Models
摘要
大语言模型(LLM)通常会被要求承担从个人到机构的社会角色,但目前尚不清楚它们的内部表征是否编码了这些角色的粒度,从微观层面的个人经验到宏观层面的组织、机构或国家推理。我们证明他们确实做到了。我们将基于对比度的粒度轴定义为平均宏观和微观角色隐藏状态之间的差异。在Qwen3-8B中,该轴与角色表示空间的主轴(PC1)在余弦0.972处对齐,并占其方差的52.6%,表明粒度是组织提示社会角色的主导几何轴。我们跨五个粒度级别构建了 75 个社会角色,并收集了针对共享问题和提示变体的 91,200 个角色条件响应,然后提取角色级别的隐藏状态并将其投影到轴上。角色预测在所有五个级别上单调增加,在各层、提示变体、端点定义、保留分割和分数过滤子集之间保持稳定,并转移到 Llama-3.1-8B-Instruct。该轴也具有因果相关性:沿着它的激活转向会在预测方向上改变响应粒度,在接受本地响应的提示的积极转向下,Llama 在五点宏观尺度上从 2.00 移动到 3.17。这两种模型的可控性不同,这表明转向取决于每种模型的默认操作方式。总体而言,我们的研究结果表明,社会角色粒度不仅仅是一种文体表面特征,而且是角色条件语言模型行为中结构化、有序且可因果操纵的潜在方向。
