论文

PPO-HSC:基于广域策略覆盖优化的探索性强化学习框架

PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization

模型训练强化学习RLVR

摘要

本文提出PPO-HSC(带高阶采样覆盖的近端策略优化),一个旨在解决大语言模型(LLM)微调中模式坍缩这一“隐形枷锁”的探索性强化学习框架。标准的可验证奖励强化学习(RLVR)能有效强化高奖励轨迹,但常导致模型过度优化已知解,牺牲好奇心与探索更广解空间的能力。为此,PPO-HSC引入高阶采样覆盖(HSC)奖励,激励发现“低相似度但高有效性”的推理模式。该框架维护一个经验证的独特解的动态轨迹库,提供可微的信号,在以合理性约束确保结构理性的同时奖励语义新颖性。在数学推理(GSM8K、SVAMP)与代码生成任务上的实证评估表明,PPO-HSC显著提升解的多样性与状态空间覆盖,同时保持或超越最先进RL基线的准确率与语法完整性。

PPO-HSC:基于广域策略覆盖优化的探索性强化学习框架:论文配图
图 1:标准 PPO 和 PPO-HSC 标准 PPO 之间的保单覆盖范围比较(模式搜索)。标准算法表现出“模式寻求”行为,倾向于单一路径利用。这导致模式崩溃,模型只是加速已知的解决方案,而不是探索更广泛的策略空间。 PPO-HSC(广域覆盖):我们的框架通过奖励“低相似性但高有效性”轨迹将重点转移到边界扩展。这使得推理流形能够实现广域覆盖。机制:通过维护动态轨迹库𝒟\mathcal{D},PPO-HSC 量化生成序列相对于历史已知经验的新颖性。结果:模型被激励去发现多样化的、逻辑上合理的推理链,同时保持高精度。