论文

AMD:多任务后训练的自适应互蒸馏

Adaptive Mutual Distillation for Balanced Multi-Task Post-Training of Large Language Models

摘要

LLM的多任务后训练旨在提升训练数据量不等的任务间性能。现有方法主要聚焦单模型训练中的任务贡献平衡。不同的任务平衡策略可产生优势互补的模型,为互蒸馏创造机会。但跨模型监督的有用性会随任务、迁移方向与训练阶段变化。我们提出自适应互蒸馏(AMD):联合训练采用不同任务平衡策略的两个模型的协同后训练框架。AMD通过跨任务共享的短训练探针评估蒸馏权重的候选调整,再用逐任务验证分选择每个任务与迁移方向的调整。跨六个基准与三个LLM骨干,两个AMD模型的平均基准分都高于同采样策略训练的SFT基线,也优于实验中评估的任务平衡方法。合并两个训练后模型可进一步提升平均基准分并产出单一推理模型:合并模型跨三骨干平均超出多任务SFT 2.91分。