论文
用于强化微调的动态重要样本挖掘
Dynamic Important Example Mining for Reinforcement Finetuning
摘要
强化微调(RFT)越来越多地用于增强大型模型的推理能力,但其有效性取决于训练数据的选择和使用方式。大多数以数据为中心的 RFT 方法依赖于静态或启发式样本选择,隐含地假设样本值在训练过程中是固定的。这忽视了政策学习的非平稳动态,并可能导致次优更新。我们提出动态重要示例挖掘(DIEM),这是一个有原则的全自动框架,使数据利用在整个 RFT 中自适应。 DIEM 将两个组件集成到每个优化步骤中:(i)梯度对齐重要性估计器,可以有效地近似每个样本对策略改进的边际贡献; (ii) 受约束的批量重新加权方案,该方案最大化聚合效用,同时保留更新的梯度幅度以稳定优化。在多个推理基准测试中,DIEM 始终优于强大的静态和动态基准。代码将通过 https://github.com/hrtan/DIEM 发布。
