论文
稳健LLM后训练的动态最小最大遗憾优化
Dynamic Minimax Regret Optimization for Robust LLM Post-Training
摘要
现代LLM训练越来越依赖于跨越不同领域、任务、偏好分布和难度级别的异构数据源。我们研究了在瞬时小批量老虎机反馈下,群体分布稳健的LLM后训练的动态最小最大遗憾。该框架将训练视为两人采样器优化器过程:采样器使用多臂老虎机反馈在数据源中进行自适应选择,而优化器则使用所选源中的随机梯度更新模型参数。我们专注于实际限制性的设置,其中源损耗随着模型训练的变化而变化,但不会重新评估历史数据,从而要求采样器从陈旧的部分反馈中跟踪瞬时最差源。我们提出了 DUCB-OGD,这是一种简单且可扩展的算法,它将折扣上置信区间采样器与在线梯度下降优化器结合起来。采样器根据折扣的有效样本量维护指数移动平均损失估计和置信半径,避免对过去数据进行昂贵的重新评估或对标准训练管道进行侵入性更改。对于 $K$ 数据源和 $T$ 训练步骤,我们证明 DUCB-OGD 实现了 $\tilde{O}(K^{1/4}T^{3/4})$ 的动态极小最大遗憾,这对于我们的反馈模型下的未贴现目标来说在仅差对数因子的意义下最优。监督微调、偏好优化和强化学习的广泛实验表明,DUCB-OGD 无缝集成到现代LLM训练管道中,并提高了最差组的鲁棒性,与标准采样基线相比,计算开销可以忽略不计。