论文

TD-Grokking:通过训练时间分解从零奖励问题中学习

TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition

模型训练强化学习

摘要

大语言模型 (LLM) 在推理任务方面取得了显着的进步,这很大程度上是由 后训练 范式驱动的,特别是具有可验证奖励的强化学习 (RLVR)。然而,一个关键的瓶颈仍然存在:RLVR 在高度具有挑战性的零奖励问题上失败,其中所有采样的推理轨迹都会产生一致的失败结果,无法提供优化信号来驱动模型改进。先前为解决这一限制而做出的努力,例如密集的过程监督、部分奖励分配或前缀引导的探索,都受到固有的任务限制,或者没有完全使政策模型具备解决原来棘手问题所需的能力。为了解决这个问题,我们提出了 TD-Grokking,一种针对零奖励问题的训练时间分解框架。它递归地将棘手的根问题分解为独立的、可验证的子问题,形成分层树,其中可解决的叶子提供非零奖励。对数学和医学任务的评估表明,TD-Grokking 的性能优于普通 GRPO 以及所有基线方法。结合详细分析,这些结果证实训练时间分解有效地将零奖励示例转换为可用的训练信号,从而实现一致的性能增益。我们的代码和数据集可在 https://anonymous.4open.science/r/TD-Grokking-6567/ 上获取。