论文

强化学习:从算法到基础模型

Reinforcement Learning: From Algorithms To Foundation Models

模型训练强化学习Agentic RL

摘要

强化学习(RL)为显式目标下的序贯决策提供框架。经典形式中,RL研究智能体应如何行动以在动态环境中最大化长期奖励。在更丰富的设定中,问题超越单智能体与固定环境:智能行为可能需要策略性交互、对不确定性的适应以及对高维世界的推理。本论文从两个视角研究RL:博弈中的算法与基础模型时代的RL。第一部分聚焦博弈中的多智能体RL,考察激励、策略与均衡概念在竞争性与一般和环境中如何交互,覆盖双人零和博弈、大型电子游戏与具有一般结构的多玩家设定;这些工作研究多智能体系统中的学习与RL方法在交互环境中的行为。第二部分研究生成模型与基础模型背景下的RL,动因是先验知识可以丰富序贯决策:预训练生成模型与学到的世界模型充当规划、控制与策略优化的表示工具与结构化先验。论文发展基于扩散的世界模型、研究面向高效视频生成的RL、探索生成模型作为策略类,并研究动作塑造未来观测的交互式视频世界模型;还通过带记忆的架构处理长程建模。这些贡献共同呈现了RL作为复杂序贯领域中目标驱动适应的统一视角:从策略博弈到生成世界模型,论文突出RL如何连接决策、环境建模与新兴基础模型能力。

强化学习:从算法到基础模型:论文配图
图 5.3:建议的网络 LB 分布式 MARL 框架概述。