论文
迈向面向小规模语言模型智能体的稳健强化学习
Towards Robust Reinforcement Learning for Small-Scale Language Model Agents
摘要
使用强化学习对7000万至5亿参数区间的小规模语言模型(Small Language Models,SLM)进行对齐常被认为不稳定,但其底层失败机制尚未得到系统性研究。在此前最先进(State-of-the-Art,SOTA)的研究中,十五种(模型,语料)配置使用近端策略优化(Proximal Policy Optimization,PPO)进行训练。实验涵盖TinyStories、CNN/DailyMail和Wikitext-103语料上的Pythia-70M、160M、410M与SmolLM2-135M、360M。在小规模语言模型中识别出三种可复现的失败模式:标准PEFT/TRL流程中LoRA参数被静默冻结、使用bfloat16时重要性比率的数值溢出,以及奖励模型误差导致的灾难性策略崩溃。这些问题分别通过合并并重新初始化的适配器技术、PPO更新期间的float32精度,以及由奖励白化、重要性比率防护与权重回滚组成的三层安全机制来解决。本文提出容量余量假设,即SLM尺度上的PPO性能同时取决于一个流利的监督模型($\text{PPL}<20$)与有区分力的奖励信号,而非模型参数数量。所提系统在所有实验中均稳定收敛,在具备流利先验与信息性奖励信号的配置中,偏好胜率相较SFT基线有所提升。此外,它超越了指令微调基线,同时所需训练数据显著更少。所有检查点、偏好数据集与训练脚本均已公开发布$^§$。
