论文
DARE:具有共同进化难度估计的难度自适应强化学习
DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation
摘要
强化学习提高了 大语言模型 的推理能力,但仍然成本高昂且样本效率低下,因为许多部署提供的学习信号较弱。难度感知数据选择方法试图通过优先考虑中等难度的提示来解决这个问题,但我们的分析揭示了三个局限性:在政策漂移下难度估计变得不准确,数据选择本身产生的最终性能收益有限,推理效率基本保持不变。这些发现表明,高效且有效的强化学习需要的不仅仅是按难度进行过滤:策略应该学会解决困难的任务,同时为简单的任务提供简洁的响应。为此,我们提出 **Dare**,这是一个统一的框架,通过自归一化重要性采样与策略共同演化难度估计,通过对称 Beta 采样分布保持多样化的难度覆盖范围,并通过自适应计算分配在难度级别上应用定制的训练策略。跨多个模型和领域的广泛实验表明,**Dare** 在训练效率、最终有效性和推理效率方面始终优于现有方法,在简单任务上产生更简洁的响应,同时提高困难任务的正确性。代码可在 https://github.com/EtaYang10th/DARE 获取。