论文

通过多格式训练提高语言模型的跨格式鲁棒性

Improving Cross-Format Robustness in Language Models with Multi-Format Training

模型训练合成数据

摘要

大语言模型 通常对答案格式保持敏感:以一种形式正确解决的问题可能以另一种语义等效的形式失败。为了研究这一差距,我们将跨格式鲁棒性定义为模型跨格式一致回答同一基本问题的程度。然后,我们将全格式训练与 FormatMix 进行比较,后者使用随机或有针对性的选择仅将训练项目的子集扩展为多个等效格式。在 GLM4 和 Llama-3.1 中,多格式监督不断提高任务性能和跨格式鲁棒性,而仅多项选择问题 (MCQ) 监督带来的好处很少,甚至会降低鲁棒性。我们进一步发现,仅将大约 30% 的训练集扩展为多种格式通常可以恢复全格式训练的大部分收益,并且这种效果出现在我们研究的模型系列和规模中。这些结果表明,格式多样性,而不仅仅是额外的监督,才是稳健性的关键驱动力。这种轻量级多格式增强是一种实用方法,可以在不更改基本模型的情况下降低 LLM 对答案格式的敏感度。