论文

用于强化微调的动态重要样本挖掘

Dynamic Important Example Mining for Reinforcement Finetuning

模型训练强化学习

摘要

强化微调(RFT)越来越多地用于增强大型模型的推理能力,但其有效性取决于训练数据的选择和使用方式。大多数以数据为中心的 RFT 方法依赖于静态或启发式样本选择,隐含地假设样本值在训练过程中是固定的。这忽视了政策学习的非平稳动态,并可能导致次优更新。我们提出动态重要示例挖掘(DIEM),这是一个有原则的全自动框架,使数据利用在整个 RFT 中自适应。 DIEM 将两个组件集成到每个优化步骤中:(i)梯度对齐重要性估计器,可以有效地近似每个样本对策略改进的边际贡献; (ii) 受约束的批量重新加权方案,该方案最大化聚合效用,同时保留更新的梯度幅度以稳定优化。在多个推理基准测试中,DIEM 始终优于强大的静态和动态基准。代码将通过 https://github.com/hrtan/DIEM 发布。

用于强化微调的动态重要样本挖掘:论文配图
图1:我们提议的动态重要采矿实例(DIEM)的管道。与香草RFT输油管相比,我们的DIEM只引入了两个轻量级步骤:(1) 动态数据重要性测量,该测量利用我们提议的Eq.4影响估计器评估每个样本在目前批次中的重要性;(2) 动态数据重估,根据样品的重要性重新分配样品重量。重新加权步骤是作为一个有限的优化问题拟订的,它保留了整个梯度值,同时强调了最重要的样本(在Eq.6中定义,我们在Eq.7)中进一步提供了有效的封闭式解决方案。总体而言,DIEM效率高、直观且与现有的RFT算法大体一致(Shao等人,2024年;Hu,2025年;Schulman等人,2017年;Schulman等人,2015年)。