论文

OPTS-TTPO:通过树搜索增强有限样本策略梯度学习

OPTS-TTPO: Enhancing Finite-Sample Policy-Gradient Learning with Tree Search

模型训练强化学习

摘要

策略梯度定理给出了当前策略下的精确梯度,但有限的策略样本可能会错过罕见的高回报轨迹。我们研究树搜索是否在固定预算内提高其覆盖范围,同时控制梯度偏差。我们引入了使用策略树轨迹的策略并行树搜索(OPTS)和树轨迹策略优化(TTPO),它们从访问状态的当前策略中采样新的后缀。尽管分支会改变状态访问,但这不需要动作分布校正。我们的分支聚合引理表明,当在对传出转换进行采样之前固定分支选择和权重时,分支加权树统计数据会恢复链期望。 OPTS 使用估计的性能差异来选择扩展状态。在确定性动态、精确值和最大备份优势下,诱导搜索策略的预期回报随预算单调提高。我们限制了自适应扩展的梯度偏差,并表明最大备份将前缀信用分配给导致更好发现后缀的操作。与有限链参考相比,TTPG 的测量偏差保持在其无分支水平附近,而 NaivePG 的偏差从 0.1251 增长到 0.4884。在匹配的预算下,以奖励和价值为导向的 OPTS 比独立抽样提高了正确答案覆盖率和多数票准确性。在匹配的分支计数下,OPTS + TTPG 的覆盖范围相对于固定分支 + TTPG 而言略有增加。在匹配的交互或rollout预算下,OPTS-TTPO 将 MuJoCo 尾部回报比 PPO 提高了 28.6%,在最后 100 个对数平均回报指标下,在 Atari-57 上实现了 34-22-1 的平局记录,并在所有四个 Qwen3 模型中比 PPO 提高了微平均 avg@32 和 pass@32。