开源项目
maxrl:最大似然RL的官方PyTorch实现
tajwarfahim/maxrl
概述
maxrl是论文《Maximum Likelihood Reinforcement Learning》的官方PyTorch实现,供想复现或基于该方法做强化学习训练的研究人员使用。本次以新仓库发布,Apache-2.0协议,README给出从conda环境、PyTorch 2.6.0到vllm 0.8.4的完整安装步骤,设置与verl保持一致,并附多任务训练复现入口,需要GPU机器。README称该工作入选ICML 2026口头报告并获ICLR 2026 SPOT研讨会最佳论文奖。