论文
在线自称重 微调
Online Self-Weighted Fine-Tuning
摘要
标准监督 微调 (SFT) 为每个专家演示分配相同的显式损失权重,无论模型在训练查询方面的能力如何变化。基于强化学习 (RL) 的方法使用模型生成的采样轨迹来调整更新强度,但通常需要更多的采样,并且在困难任务上可能不稳定。我们提出了 \textbf{在线自加权 微调 (OSW-FT)},这是一种通过在线轨迹级加权增强 SFT 的简单方法。对于每个查询,OSW-FT 使用少量仅推理的部署来估计模型当前的成功率,并相应地重新调整标准 SFT 损失。优化方向仍然锚定于专家轨迹,而更新幅度则在线适应。对于二进制可验证推理,受方差减少原理的启发,我们将这种权重与梯度级别的 SFT 和 RL 连接起来。对于任何有限的采样轨迹数,生成的估计器对于精确的 OSW-FT 代理更新是无偏的,并且我们分析相对于相应代理目标的收敛性。在多个具有挑战性的基准(例如 AIME)上对 Qwen3 系列(从 0.6B 到 4B)进行评估后,OSW-FT 在中小型模型上始终优于 SFT。 OSW-FT 提供了有利的计算性能权衡,作为 微调 中小型 LLM 执行二进制可验证推理任务的实用方法,仅需要 \textbf{2 个在线部署}。