论文
PPO-HSC:基于广域策略覆盖优化的探索性强化学习框架
PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization
摘要
本文提出PPO-HSC(带高阶采样覆盖的近端策略优化),一个旨在解决大语言模型(LLM)微调中模式坍缩这一“隐形枷锁”的探索性强化学习框架。标准的可验证奖励强化学习(RLVR)能有效强化高奖励轨迹,但常导致模型过度优化已知解,牺牲好奇心与探索更广解空间的能力。为此,PPO-HSC引入高阶采样覆盖(HSC)奖励,激励发现“低相似度但高有效性”的推理模式。该框架维护一个经验证的独特解的动态轨迹库,提供可微的信号,在以合理性约束确保结构理性的同时奖励语义新颖性。在数学推理(GSM8K、SVAMP)与代码生成任务上的实证评估表明,PPO-HSC显著提升解的多样性与状态空间覆盖,同时保持或超越最先进RL基线的准确率与语法完整性。
