论文
隐藏到指南:通过语义屏蔽学习
Hide to Guide: Learning via Semantic Masking
摘要
具有可验证奖励的强化学习(RLVR)已成为改进推理密集型任务的语言模型的强大范例,但其有效性往往受到探索的限制。例如,模型经常在困难问题上失败,几乎没有留下有用的奖励信号。外部专家跟踪提供了自然的指导来源,但它们也可能会沿着通往验证者目标的关键路径暴露与奖励相关的内容,例如最终答案、中间值、可执行实现或与答案相关的实体。此内容可以创建一个意想不到的 奖励作弊 通道,允许策略通过复制跟踪而不是学习底层推理或代理行为来获得奖励。现有的引导强化学习方法通过使用部分轨迹来降低这种风险,但它们主要控制启发式显示多少专家信息,而不是应该隐藏哪些部分。为此,我们提出了语义屏蔽专家策略优化(SMEPO),这是一种针对专家引导的 RLVR 的细粒度语义屏蔽策略。 SMEPO 不是粗略地截断痕迹或将其显示为不变,而是沿着关键路径掩盖与奖励相关的语义跨度,同时保留专家的分解、计划和程序结构。这将难题从从头开始推理变成了填空过程:策略可以遵循专家的问题解决路线,但仍必须自行重建缺失的值、代码或实体。 SMEPO 易于应用,无需更改奖励函数或 RL 目标。在数学、代码和代理搜索等不同领域,SMEPO 的准确性比 GRPO 提高了 3.2 个百分点,并将训练时间缩短了 4.2 倍。该代码可在 https://github.com/mit-han-lab/SMEPO 获取。