论文
变分近端策略优化:用专家几何关系约束策略更新
Variational Proximal Policy Optimization
摘要
通过近端策略优化从人类反馈中进行强化学习通常会遇到策略模式崩溃、脆弱的探索循环和分布漂移的问题。本文介绍了变分近端策略优化 (\(\textsc{VP}_2\textsc{O}\)),这是一种基于粒子的变分推理框架,可将策略优化映射到混合专家架构中的 Stein 变分梯度下降。通过利用局部专家原型上的功能内核以及专家正交化损失,\(\textsc{VP}_2\textsc{O}\) 引入了一种基于几何的近端控制机制,可以减少对固定裁剪或 KL 调度的依赖。我们在 33B/4B 稀疏专家混合模型上的结果显示了复杂推理基准的多项改进,在 Codeforces 上建立了 \(+\mathbf{179}\) ELO 增益,并在 AIME 数学推理任务上减少了 \(\mathbf{32\%}\) 标记计数。