论文
DiaLLM:英语方言适应中鲁棒性代沟的调查
DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation
摘要
大语言模型 越来越理解方言英语,但仍然只产生标准的、倾向于美国的英语,而方言生成(问题的更难部分)基本上没有得到解决。我们引入了 DiaLLM,它在国际英语语料库上持续预训练三个开放权重语言模型家族,并应用隐式和显式 后训练 范式,每种范式都结合了三种模型对齐策略,首次对澳大利亚英语、印度英语和英国北部英语中的这些组件进行了受控比较。我们的结果揭示了鲁棒性与生成的差距:基准是由持续的预训练和 SFT 塑造的,而对齐以基准未捕获的方式明显地重塑了生成。明确的针对品种的适应产生的输出被可靠地识别为方言,并且被判断为比广泛对齐更方言,但是在直接评估人类判断的情况下,最积极地优化方言奖励的方法并不是被判断为最方言的方法。独立的语言分析证实了这种奖励质量的差距,在三个家庭中的两个家庭中最为明显。没有单一的对齐方法占主导地位,缩小差距需要更丰富的奖励设计和对方言资源的持续投资。我们发布所有代码、检查点和首选项数据集。