论文
无需训练 通过角色分歧实现 大语言模型 的文化一致性
Training-Free Cultural Alignment of Large Language Models via Persona Disagreement
摘要
大语言模型 越来越多地调解依赖道德判断的决策,但越来越多的证据表明,他们的隐性偏好在文化上并不中立。现有的文化一致性方法要么需要每个国家/地区的偏好数据和 微调 预算,要么假设对商业 API 不公开的模型内部进行白盒访问。在这项工作中,我们关注这种现实的黑匣子、仅限公共数据的制度,并观察到国内社会人口分歧,而不是共识,是主要的指导信号。我们引入了 DISCA(文化对齐的分歧知情指导),这是一种推理时间方法,它将每个国家实例化为一组基于世界价值观调查的角色代理,并将他们的分歧转化为有界的、损失规避的 logits 校正。在 20 个国家和 7 个开放权重主干网 (2B--70B) 中,DISCA 在不改变任何权重的情况下,在 6 个 >=3.8B 的主干网上将 MultiTP 上的文化错位减少了 10--24%,在开放式场景中将文化错位减少了 2--7%。我们的结果表明,推理时间校准是 微调 的可扩展替代方案,可服务于全球道德偏好的长尾。