技术实践
Uber结合开源与自研做 LLM 的训练与微调优化
概述
Uber的LLM应用覆盖Uber Eats推荐与搜索、客服机器人、代码开发与SQL生成等场景,既用Llama 2、Mixtral等开源模型,也用OpenAI、Google等闭源服务。除RAG外,还通过持续预训练与指令微调注入Uber领域知识:据介绍,用Uber自有菜品与餐厅知识微调的模型,在商品标注、搜索query与用户偏好理解上优于开源基线,效果接近GPT-4且能承载更大流量。工程上,Uber在Michelangelo平台基于PyTorch、Ray、Transformers、DeepSpeed、vLLM等开源组件自建分布式训练与离线评估设施:训练负载由Kubernetes与KubeRay调度,跑在本地A100集群与谷歌云H100实例上,支持LoRA/QLoRA与全参微调。官方称,DeepSpeed ZeRO-3 CPU offload使Llama 2 70B训练同等batch下减少34%显存、吞吐提升2-3倍;flash attention可省50%显存,32卡训练中batch可扩大2-7倍;Mixtral 8x7B批预测基准显示H100吞吐约为A100的3倍。