论文
ISO:RLVR 原生优化堆栈
ISO: An RLVR-Native Optimization Stack
摘要
具有可验证奖励的强化学习(RLVR)正在迅速提高语言模型的推理能力,但将奖励反馈转换为权重空间更新的优化层仍然知之甚少。基于我们之前的分析(Zhu et al., 2025),我们通过模型权重的奇异结构来研究这个缺失的层,并识别谱继承:RLVR 可以重用基础模型的权重谱,同时通过相关输入和输出奇异帧的变化来获取新的行为。我们将谱继承操作为等谱优化 (ISO),这是一种 RLVR 原生的固定谱优化框架,具有互补的离线和在线实例化。离线时,ISO-Merger 将共享基础专家的框架更改组合到单个固定频谱模型中,不需要合并后数据、采样轨迹、梯度更新或 同策略 蒸馏 (OPD)。它恢复了互补的专业能力,并在比较的无数据合并方法中实现了最强的聚合性能。在线时,ISO-Optimizer 将选定的基础优化器(包括 AdamW 和 Muon)应用于帧变量,同时保持基础光谱固定。在从 1.5B 到 8B 参数的推理和编码任务中,ISO-Optimizer 提高了报告运行的准确性,并以更少的训练步骤达到匹配的分数。在 Qwen3-8B-Base 上,AdamW 经过 270 个训练步骤后达到了 0.495 的总精度。 ISO-AdamW 仅在 100 个训练步骤后就达到了相同的精度,并在 210 个训练步骤后进一步提高到 0.509。 ISO 共同为 RLVR 缺失的优化层提供了具体答案:不是继承 预训练 优化批发,而是围绕奖励驱动的适应结构设计 后训练:继承频谱,优化帧。