论文

迈向面向小规模语言模型智能体的稳健强化学习

Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

模型训练强化学习Agentic RL

摘要

使用强化学习对7000万至5亿参数区间的小规模语言模型(Small Language Models,SLM)进行对齐常被认为不稳定,但其底层失败机制尚未得到系统性研究。在此前最先进(State-of-the-Art,SOTA)的研究中,十五种(模型,语料)配置使用近端策略优化(Proximal Policy Optimization,PPO)进行训练。实验涵盖TinyStories、CNN/DailyMail和Wikitext-103语料上的Pythia-70M、160M、410M与SmolLM2-135M、360M。在小规模语言模型中识别出三种可复现的失败模式:标准PEFT/TRL流程中LoRA参数被静默冻结、使用bfloat16时重要性比率的数值溢出,以及奖励模型误差导致的灾难性策略崩溃。这些问题分别通过合并并重新初始化的适配器技术、PPO更新期间的float32精度,以及由奖励白化、重要性比率防护与权重回滚组成的三层安全机制来解决。本文提出容量余量假设,即SLM尺度上的PPO性能同时取决于一个流利的监督模型($\text{PPL}<20$)与有区分力的奖励信号,而非模型参数数量。所提系统在所有实验中均稳定收敛,在具备流利先验与信息性奖励信号的配置中,偏好胜率相较SFT基线有所提升。此外,它超越了指令微调基线,同时所需训练数据显著更少。所有检查点、偏好数据集与训练脚本均已公开发布$^§$。

迈向面向小规模语言模型智能体的稳健强化学习:论文配图
图 1:用于调整小语言模型代理的端到端 RLHF 管道。该管道由五个连续阶段组成:(0)数据管理,其中使用截断、改组和不匹配生成偏好对; (1) SFT训练,生成有监督先验πSFT\pi_{\text{SFT}}; (2) 使用 Bradley-Terry 目标进行奖励模型训练; (3)PPO优化,应用合并和重新初始化程序和三层安全机制(奖励白化、重要性比上限和权重回滚)来减少特定规模的不稳定性; (4) 使用保留的提示进行评估。实线箭头表示主要数据流,红色虚线箭头表示控制信号(例如,KL 参考),虚线箭头表示进入每个阶段状态框的梯度流。彩色点代表操作模式(蓝色:学习;金色:推理)。侧边栏符号:r^​(s,a)\hat{r}(s,a) 是来自 Bradley-Terry 模型 rphi​(p,y)r_{\phi}(p,y) 的奖励,并且 (s,a)(s,a) 在单轮设置中减少为 (p,y)(p,y); Φ\Phi 和 𝒥\mathcal{J} 表示更新算子和 PPO 目标 J⁡(θ)J(\theta),两者都不同于文本中使用的 CDF Φ\Phi 和 MDP 元组 ℳ\mathcal{M}。