论文
大语言模型 中的文化错位:通过有针对性的 微调 进行检测、测量和缓解
Cultural Misalignment in Large Language Models: Detection, Measurement, and Mitigation Through Targeted Fine-Tuning
摘要
我们根据三个国家 63 个人口角色的世界价值观调查第 7 波数据评估了三个开放权重 LLM(来自美国的 Gemma3-12B、来自波兰的 Bielik-11B-v3 和来自中国的 Qwen3-4B),使用归一化 Wasserstein 距离来量化分布偏差。与预期相反,没有一个模型对自己的祖国有利:中国制造的 Qwen3-4B 在其自己的中国人口中表现最差(W1 = 0.436,整个模型 x 国家矩阵中最高的错位)。针对五个最坏情况角色的 LoRA 微调,需要少于 1,200 个训练对,并且在单个 GPU 上花费不到 15 分钟,Bielik-11B (p_Bonf = 0.002,d = -4.4) 的偏差减少了 16.8%,所有五个目标均得到改善。然而,国家层面的分解表明,微调 重新分配而不是消除偏见:Bielik 的最坏情况角色完全从美国老年人转换为中国老年人,校正前和校正后集之间的重叠为零。据我们所知,这是第一项针对最坏情况的人口角色使用 LoRA 微调 缓解跨文化偏见的研究。