论文
内省 X 训练:反馈调节可改善所有 LLM 训练阶段的扩展
Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages
摘要
我们解决的问题是如何在当前 LLM 训练管道的许多不断增长的阶段中更有效地扩展。我们的指导直觉源于这样一个事实:管道后期阶段的动态,例如后训练,可用于通知早期阶段,例如 预训练。为此,我们提出内省训练(或 IXT),其灵感来自离线奖励条件强化学习,适用于训练的任何阶段。 IXT 使用思维奖励模型通过基于自然语言批评的反馈来注释数据,从而从管道的最早阶段开始进行质量意识训练。然后,通过使用生成的反馈对数据进行前缀条件来训练模型,以确保在训练中并非所有标记都在比平常更早的时间开始得到平等对待。对基于 7.5-12B Transformer 的密集 LLM 从头开始训练到 18 万亿个词元的综合实验表明,我们的方法: 弯曲缩放曲线,通常可将计算效率提高 2.8 倍;并达到了在数学和代码等领域进行其他训练的模型无法达到的性能水平。