论文
社交模拟语言模型的角色引导
Role Steering of Language Models for Social Simulations
摘要
从语言模型代理构建的社会模拟需要角色条件行为,可以在将代理放入模拟群体之前对其进行检查。我们为角色条件代理引入了激活引导筛选工作流程:定义角色配置文件,提取特定于角色的方向,扫描四个转向系数,评估角色配置文件对齐,并通过或标记每个候选配置。在 OLMo-3-7B-Instruct 上,我们将工作流程应用于包含 228 个角色不可知问题的混合 275 个角色清单、GPT-4.1-mini 提示角色参考和 GPT-4.1-mini 法官。与先前角色矢量工作中的辅助轴方向控制相比,特定于角色的方向获得更高的角色配置文件对齐判断,在测试网格中的平均总分分别为 63.2 和 41.1。它们还保留了较高的词汇多样性,而控制力在系数较大时急剧下降。角色级别屏幕是主要的实际输出:大多数角色随着转向的增加而改善,但 38 个角色在所有六个测量维度上都下降,这表明为什么模拟构建者应该为每个角色选择系数而不是部署统一的高强度设置。我们在 https://anonymous.4open.science/r/anonymous-research-code-5F03/ 上提供我们的代码和评估工件。