论文
Rufus-Air:开放式大语言模型后训练秘诀
Rufus-Air: An Open LLM Post-Training Recipe
摘要
Rufus-Air 是 GLM-4.5-Air-Base (106B-A12B) 上的开放且可复制的后训练配方,组织为八个阶段的串行管道:SFT、推理 RL、编码 RL、指令跟踪 RL、通用代理、编码代理、搜索代理和 RLHF。我们记录重现配方所需的数据、奖励设计、基础设施、阶段顺序和阶段结果。从基本能力到高级能力,从硬性、可验证的奖励到基于判断的软性信号的阶段。训练建立在开源组件和公共数据的基础上,其中大部分使用已发布的数据,无需新的人工注释或内部蒸馏老师。我们的主要发现是 (i) 多样化、高质量的 SFT 建立了强大的能力基础; (ii) 难度过滤使 RL 提示保持在有效的学习范围内; (iii) 奖励可靠性为排序阶段提供了实用原则; (iv) 基础设施和工程选择是方案的一部分,而不仅仅是实施细节。 Rufus-Air 在官方 GLM-4.5-Air 训练后版本的基础上进行了改进,并且与类似尺寸的开放模型具有竞争力。