论文

模拟社会的极限:后训练与调查微调如何抹平跨文化差异

The Limits of Simulated Societies: How Post-Training and Survey Fine-Tuning Erase Cross-Cultural Variance

模型评测鲁棒性、公平性与可信度评测

摘要

用大语言模型(LLM)模拟多样化人群有望变革计算社会科学的诸多方面,但许多评估只给平均响应打分,而不关注真实群体内部的意见离散度。我们开发一个诊断框架,在来自世界价值观调查(WVS)、横跨十二个国家与六大洲的 10,000 个受访者-问题对上,同时测量点准确率与离散度保持率(预测标准差与人类标准差之比,DR)。我们评估十一个零样本语言模型和五个用 SFT、DPO、GRPO 在 WVS 数据上微调的变体。我们识别出一种称为共识塌缩(consensus collapse)的失败模式:对齐训练把输出压缩为每个群体一种刻板印象。沿从 Llama 3.1 70B 基座到 Tulu 3 检查点的后训练轨迹,第一阶段监督指令微调就移除了一半的离散度而准确率几乎未增(DR 从 1.22 到 0.59;准确率 +0.9 点),后续阶段未能恢复,且 WEIRD 与非 WEIRD 国家之间出现差距,而调查微调在追求更高点准确率的同时进一步加深了这一差距。最准确的模型(在 WVS 上微调的 Tulu 3 70B-DPO,57.9%)总体只保留一半的人类离散度(DR=0.50),对尼日利亚仅保留 11%,而 WEIRD 国家为 0.70—0.87。把采样温度提高到 1.0,对两个微调 DPO 模型而言与人类分布的 Wasserstein-1 距离不变;在 Qwen 3.5 9B 上,无论用准确率奖励还是分布形态奖励,GRPO 都无法恢复离散度。把对齐模型与未对齐先验混合,在留出划分上把 DR 从 0.51 提到 0.62,但尼日利亚仍只有 0.36。因此,仅看点准确率会误判这些模拟器,而当前的后训练是在用多样性换共识。

模拟社会的极限:后训练与调查微调如何抹平跨文化差异:论文配图
图 4:Tulu 3 70B-DPO(+WVS)的逐单元格 σr(12 个国家 × 6 个问题)。Q189 一列全为零(完全的模式坍缩)。WEIRD/非 WEIRD 的分野在纵向上清晰可见:WEIRD 国家(上方各行)仍保留中等程度的分散度,而非 WEIRD 国家(下方各行)在大多数问题上几乎完全坍缩。