论文
不只看能否解答:以任务可学习性作为LLM强化学习后训练的静态先验
Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training
摘要
强化学习是提升LLM推理的重要后训练方式,但均匀采样不考虑不同任务对优化的响应差异。已有任务估值多使用当前通过率或奖励等快照信号,衡量当前策略能否解决任务;当前可解性相近的任务,对后续训练的改善响应仍可能不同。本文将这一区别定义为任务可学习性,即固定强化学习后训练设置下,继续训练预期带来的正向响应。逐任务奖励轨迹分析显示,可学习性在独立采样的训练上下文间可复现,并能预测下游效用。TrajVal以短时探测训练及两次端点评估近似估计逐任务可学习性,可作为独立静态采样先验,或与已有在线调度器相乘。多个模型尺度的数学与逻辑基准实验显示,相比均匀采样,TrajVal提高数据效率,并与在线调度方法形成互补。