论文
PolyFact:比较一致性驱动的 后训练 跨语言事实回忆方法
PolyFact: Comparing Consistency-Driven Post-training Methods for Cross-Lingual Factual Recall
摘要
大语言模型 (LLM) 主要接受英语数据训练,编码大量世界知识,但往往无法用其他语言可靠地表达它,这种现象称为跨语言事实不一致。为了研究这个问题,我们引入了 PolyFact,这是一个完全并行的多语言事实 QA 数据集,包含 12 种类型不同语言的 6 万个基于 Wikidata 的事实,并提出了具有跨语言奖励池的一致性驱动的 GRPO。我们将我们的方法与有监督的 微调 (SFT) 以及 OLMo-2-1124-7B 和 Qwen-2.5-7B 上的一致性增强基线 DCO 和 CM-Align 进行比较,并分析并行数据上的轻连续预训练 (CPT) 是否为 后训练 提供了有用的基础。没有单一方法占主导地位:SFT 最大限度地提高了分布内的准确性,但不是一致性,DCO 产生了最强的一致性增益,但未能转移到自由形式生成,而我们的 GRPO 变体在多语言基础模型上实现了对自由形式回忆和未见过的语言的最强转移。 CPT 对单语言模型有一定帮助,但对多语言模型有损害。机制分析表明,GRPO 与语言专业化程度的降低有关,这与跨语言表征的更大程度共享是一致的。我们公开发布我们的代码、模型和数据集。