论文
AlignCultura:走向文化一致 大语言模型?
AlignCultura: Towards Culturally Aligned Large Language Models?
摘要
大语言模型 (LLM) 中的文化一致性对于产生情境意识、尊重和值得信赖的输出至关重要。如果没有它,模型就有可能产生刻板的、麻木不仁的或误导性的反应,而这些反应无法反映有益、无害和诚实 (HHH) 范式的文化多样性。现有基准代表了文化协调的早期步骤;然而,目前还没有基准能够根据联合国教科文组织关于 HHH 范式的文化多样性原则对文化一致性进行系统评估。因此,为了解决这一差距,我们建立了 Align-Cultura,即文化协调的两阶段管道。第一阶段通过查询构建构建 CULTURAX,这是基于联合国教科文组织文化分类的 HHH-英语数据集,它对提示进行重新分类,扩展代表性不足的域(或标签),并使用 SimHash 防止数据泄漏。然后,响应生成通过两阶段拒绝抽样将提示与基于文化的响应配对。最终数据集包含 1,500 个样本,涵盖有形和无形文化形式的 30 个子领域。第二阶段在通用模型、文化微调模型和开放权重 LLM(Qwen3-8B 和 DeepSeek-R1-Distill-Qwen-7B)上对 CULTURAX 进行基准测试。根据经验,文化微调模型将联合 HHH 提高了 4%-6%,将文化失败减少了 18%,实现了 10%-12% 的效率增益,并将泄漏限制在 0.3%。