论文

Puro-2B:Poor Lab 的 Qwen2-1.5B 在 RTX 5090 上进行训练,花费 5090 美元

Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

模型训练预训练

摘要

语言模型预训练几乎已经成为成本高昂的代名词,使得许多学术和开源社区无法承受。尽管已经存在强大的开源工作,包括开放权重模型和开源训练方案,但长期以来一直缺乏具有成本效益、硬件可访问且开源的预训练方案。即使是小规模,训练 Llama-3.2-3B 的成本也超过 150 万美元,复制 SmolLM3-3B 需要超过 70 万美元。在本报告中,我们提出了一种开放的预训练方法,旨在降低这一障碍。使用此配方,我们在消费级 RTX 5090 GPU 上以 FP8 精度从头开始训练一系列 Puro-2B 模型,数据量高达 1.4 万亿个。该系列中的模型在 词元预算 和选定的配方变体方面有所不同。我们最好的模型以低于 6.9K 美元的计算成本进行训练,并在我们的评估协议下接近 Qwen2.5-1.5B 性能。这种成本效率是通过多种方法组合实现的,包括硬件选择、低精度训练、超球优化、课程模型平均和数据配方。除了配方本身之外,我们还提供了两个额外的结果。首先,在 Puro-2B 系列中,我们推导出 Puro 成本缩放法则,将训练成本与平均模型性能联系起来;拟合定律表明,大约 4.4K 美元(不到 5,090 美元)足以达到 Qwen2-1.5B 的性能。其次,作为端到端案例研究,我们研究了预训练数据课程如何影响 后训练 后的下游性能。这种对照研究是通过访问完整的预训练流程而不是单独的模型权重来实现的。我们在 https://huggingface.co/collections/thu-pacman/puro-2b 上发布了 Puro-2B 的完整训练方案,包括 Apache 2.0 下的数据、代码和模型权重。