论文

LLM 强化课程判断内化 微调

Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

模型训练强化学习

摘要

在 LLM 强化 微调 (RFT) 中,课程学习可提高效率和绩效。然而,当前的方法通过手工设计的启发式或辅助模型将课程判断外化,存在与政策的训练动态不一致的风险。在本文中,我们介绍了 METIS(元认知内化自我判断),这是一种将课程判断内化为原生能力的新颖框架。利用提示内奖励方差有效衡量提示信息量的关键观察,METIS 根据最近的训练结果作为轻量级上下文学习示例来预测该指标。这种内在的自我判断会动态地决定训练分配。此外,METIS通过联合优化标准RFT奖励和自我判断奖励来闭合判断和优化之间的循环。这使得策略可以作为元认知的一种形式来了解下一步要学习什么。在数学推理、代码生成和代理函数调用基准测试中,METIS 提供了卓越的性能,同时实现了高达 2.1 倍的训练加速,并通过受控消融和深入分析进一步验证了内化课程判断的优势。通过绕过手工设计的启发式和辅助模型,我们的工作为 LLM 强化 微调 建立了一个简单、闭环、高效的课程内化范式。