论文

具有可验证奖励的强化学习的非空泛化界限

Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards

模型训练强化学习

摘要

虽然具有可验证奖励的强化学习 (RLVR) 被广泛用于提高 大语言模型 (LLM) 的推理能力,但所得模型的普遍性仍然知之甚少。在这项工作中,我们为十亿参数规模的参数高效 RLVR 微调 建立了第一个非空泛化界限。我们的方法使 PAC-Bayes 压缩范围适应此设置,并通过应用 Gumbel-max 重新参数化技巧来解决词元生成的固有随机性。为了实现这些界限,我们提出了渐进式 RLVR 框架,它将 RLVR 与 同策略 蒸馏、TinyLoRA 和模型量化集成在一起。根据经验,渐进式 RLVR 保留了标准 LoRA 微调 84-97% 的性能,同时生成可压缩性提高 14,796 倍的模型。我们证明该框架在四个领域产生非空泛的泛化界限:数学问题解决、编程、一般知识推理和文本到 SQL。我们的界限超出基本模型的准确度 9-51%,并且与微调模型的准确度相差 6-11%。