论文
Tevatron 与 Megatron:基于学术预算的专家并行 LLM 重排器训练
Tevatron Meets Megatron: Expert-Parallel LLM Reranker Training on an Academic Budget
摘要
现代重新排名方法——数十亿规模的交叉编码器、专家混合 (MoE) 骨干和针对强大教师的 蒸馏——已经超过了大多数学术团体可用的训练基础设施。现有的 Tevatron reranker 训练依赖于带有 DeepSpeed 或 PyTorch FSDP1 的 Hugging Face Trainer,但这些后端缺乏对大规模 MoE 训练的有效支持。我们推出了 Tevatron 3.0,它将 Megatron-Core 训练后端集成到 Tevatron 中,同时保留其数据管道、评估工作流程和 Hugging Face 兼容检查点。我们针对新后端对现有分布式训练配置进行基准测试,结果表明,Megatron 在可比较的数据并行设置下与 FSDP 重排器质量和训练效率相匹配,在推荐的单节点配置中速度提高了 22%,并且支持 LoRA 和全参数 微调。至关重要的是,专家并行性可以训练 30B 参数 Qwen3-30B-A3B MoE 重新排序器,而这在 PyTorch FSDP1 中是不可行的。使用此框架,我们对 MoE 与密集模型、LoRA 与全参数调整、蒸馏 与 BEIR-15 上具有三个第一阶段 检索器 的对比训练进行受控比较,并报告 Hugging Face 和 vLLM 的服务吞吐量。我们发现 MoE 重新排序器匹配密集 8B 质量,同时激活不到一半的参数,并实现更高的推理吞吐量。我们将发布框架和经过训练的检查点。