论文
Apriel-Reasoner:RL 后训练 用于通用和高效推理
Apriel-Reasoner: RL Post-Training for General-Purpose and Efficient Reasoning
摘要
使用具有可验证奖励的强化学习(RLVR)跨不同领域构建通用推理模型已被前沿开放权重模型广泛采用。然而,他们的训练方法和领域混合通常不会被公开。跨领域的联合优化提出了重大挑战:领域在轨迹采样长度、问题难度和样本效率方面差异很大。此外,具有长思维链轨迹的模型会增加推理成本和延迟,使得效率对于实际部署至关重要。我们提出了 Apriel-Reasoner,它在 Apriel-Base(一个 15B 参数开放权重 LLM)上使用可重复的多域 RL 后训练 配方进行训练,使用公共数据集跨五个领域:数学、代码生成、指令跟踪、逻辑谜题和函数调用。我们引入了自适应域采样,尽管存在异构的轨迹采样动态,但仍能保留目标完成的采样轨迹比例,以及难度感知的长度惩罚,在没有额外的训练开销的情况下,鼓励对困难问题进行更长的推理,对简单问题进行更短的跟踪。经过严格的 16K 词元输出预算训练后,Apriel-Reasoner 在 32K 输出预算下仍然有效,并且在 AIME 2025、GPQA、MMLU-Pro 和 LiveCodeBench 上比 Apriel-Base 有所改进,同时产生的推理轨迹缩短了 30-50%。在评估的类似规模的开放权重模型中,它使用完全公开的数据配方改进了准确性与词元的权衡。