论文
经条件策略混合展示泛化失败
Demonstrating Generalization Failures via Mixtures of Conditional Policies
摘要
前沿语言模型的后训练在精选任务集合上进行——不可避免地在训练与部署环境之间留下分布偏移。这使开发者暴露于泛化失败——而泛化失败相对缺乏理解。为更好理解此类泛化失败——我们认为社区应在简化条件下构建干净的演示。为此——我们提出一种简单灵活的方法:构建在随后于给定训练任务分布上进行强化学习(RL)训练时以可控方式泛化失败的语言模型。我们的构造在对应于一组条件策略的混合转录数据集上进行监督微调——每个条件策略可在每个不同任务分布上被独立指派特定行为——以获得可良好近似为条件策略混合的模型。我们观察到RL训练随后选择在训练分布上获得最高奖励的策略。这可产生惊人行为:在含相同问题前置两种不同触发字符串的双分布受控设定中——在任一分布上的RL训练主动将另一分布上的性能降至零——即使底层任务完全相同。我们还用该构造展示未来语言模型泛化可能失败的两种新颖方式——分别对应任务覆盖与时间语境的分布偏移。虽然我们的构造刻意简单且可能与自然泛化失败不甚相似——但产生的模型实验对象对对齐压力测试与泛化科学有价值——并可作为训练成功与泛化能以结构化方式分离的存在性证明。