论文
Cog-DRIFT:对自适应重构实例的探索使得能够从硬推理问题中学习
Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems
摘要
可验证奖励的强化学习(RLVR)提高了 LLM 的推理能力,但仍然存在一个基本限制:模型无法从在当前策略下太难解决的问题中学习,因为这些问题不会产生有意义的奖励信号。我们提出了一个基于任务重新制定的简单而有效的解决方案。我们将具有挑战性的开放式问题转化为认知上更简单的变体——例如多项选择和完形填空格式——保留原始答案,同时减少有效搜索空间并提供更密集的学习信号。这些重新表述涵盖了从判别性任务到生成性任务的范围,我们利用这些任务来引导学习:模型首先从结构化的、更简单的格式中学习,然后将这些知识传回以提高原始开放式问题的性能。基于这一见解,我们引入了 Cog-DRIFT,这是一个构建重新制定的变体并根据难度将它们组织成自适应课程的框架。训练从简单到困难的格式进行,使模型能够从以前在标准 RL 后训练 下产生零信号的问题中学习。 Cog-DRIFT 不仅改进了最初无法解决的难题(Qwen 的绝对值 +10.11%,Llama 的绝对值 +8.64%),而且还可以很好地推广到其他保留的数据集。在 2 个模型和 6 个推理基准中,我们的方法始终优于标准 GRPO 和强大的引导探索基准。平均而言,Cog-DRIFT 比第二好的基线提高了 +4.72% (Qwen) 和 +3.23% (Llama)。我们进一步表明,Cog-DRIFT 提高了测试时的 pass@k,并且课程提高了样本效率。总的来说,我们的结果强调任务重新制定和课程学习是克服 LLM 后训练 中探索障碍的有效范例。