论文

摆脱模式抽签:多重响应训练提高语言模型泛化能力

Escaping the Mode Lottery: Multi-Response Training Improves Language Model Generalization

模型训练监督微调与指令调优

摘要

现代语言模型 微调 通常将每个提示与单个响应配对,即使许多提示允许多个有效完成。这有效地将多模态条件分布简化为单样本视图,我们将这种现象称为“模式抽签”,其中训练强调合理模式的子集,而其他模式的代表性不足。我们研究了多重响应训练(MRT),它为每个提示保留多个响应,并对其何时以及为何有帮助制定了原则性说明。我们的主要见解是,提示和响应是不同的统计资源:额外的提示减少了输入分布的不确定性,而额外的响应减少了条件输出分布的不确定性。这产生了方差预算权衡,可以预测何时保留多个响应是值得的,显示出随着提示级别的不确定性占主导地位而收益递减,并解释了为什么大型冗余语料库可以表现出隐含的多响应效应。我们进一步分析响应选择,并表明 Random-K-of-N 是分布式 微调 的无偏默认值,基于奖励的选择可以导致模式崩溃,子模块质量多样性目标提供了具有理论保证的有效替代方案。受控模拟验证了预测的方差和选择效应,包括一种引人注目的失败模式,其中仅奖励选择会产生与真实目标不一致的梯度。在结构化和现实世界的数据集中,包括新的多提示、多响应基准,MRT 持续改进分布泛化,在高响应多样性、低提示冗余机制中获得最大收益。 MRT 将响应多重性重新定义为一个具有明确指导的数据分配问题:当响应廉价且多样化时,保留多个响应不是一种启发式的选择,而是一种基于统计的选择。