论文
多语言语言模型中跨语言一致性增强方法的系统评估
A Systematic Evaluation of Cross-Lingual Consistency Enhancement Methods in Multilingual Language Models
摘要
多语言模型通常会对跨语言的语义等效问题产生不一致的答案,从而激发了提高跨语言一致性(CLC)的方法。然而,现有方法通常使用不同的模型、任务和协议进行评估,因此它们的相对优势尚不清楚。在这项工作中,我们对用于问答的代表性 CLC 增强方法进行了统一评估,涵盖三个模型系列和三个封闭式基准的推理时间干预和 后训练 方法。结果表明,后训练 方法通常更可靠,直接分布对齐在所有模型-数据集组合中持续改进 CLC,而其他方法对答案格式和语言覆盖范围更敏感。值得注意的是,除非源任务和目标任务共享相似的输出格式,否则跨域传输是有限的。我们进一步研究 CLC 增强是否会损害模型*在需要时*(即在询问与文化相关的问题时)做出不同反应的能力。在文化多元化问答的两个基准中,我们发现受控封闭式评估没有系统性退化,而开放式生成则显示出偶尔的准确性下降,特别是对于非英语回答。我们的工作强调需要评估 CLC 增强功能以实现跨域稳健性和文化适当的变化,为 后训练 和基准开发的未来工作提供信息。