论文

韩国文化融入 LLM 联盟:走向文化一致性

Korean Culture into LLM Alignment: Toward Cultural Coherence

模型训练合成数据

摘要

大语言模型 的文化方面工作主要由一个负面目标主导:要抑制哪些输出。我们认为还需要一个建设性的对应物,即对文化上一致的反应是什么的有效定义,而不仅仅是必须避免的反应,并为韩国人实例化它。我们围绕基于提示的 LLM 种子生成器设计了一个对齐数据管道,该生成器扩展了韩国危害分类法,以适合韩国文化的安全响应政策为中心:基于韩国法律框架、社会规范和解释惯例的按类别指南,三个前沿模型各自产生候选响应。由此产生的三元组的 DPO 微调 提高了六个开放权重 LLM 中的韩国文化安全率,同时不会导致韩国一般能力基准大幅下降,定性输出显示了命名韩国法规和机构程序的微调模型,并在适当的情况下提供建设性的韩国背景信息以及拒绝。