论文

ChunkFT:以动态工作集降低全参数微调的显存开销

ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning

模型训练参数高效训练

摘要

ChunkFT 是显存高效的微调框架,以动态激活的工作集重新组织全参数微调。无需修改网络架构即可为任意子张量计算梯度,为优化任意子网络提供算法基础,同时避免标准稠密梯度计算。作者给出确定性设置下的理论收敛分析。 实验分别用单张 RTX 4090 24GB 和两张 H800 80GB 微调 Llama 3-8B 与 Llama 3-70B。7B 模型在 1K 输入长度下的全参数微调仅需 13.72GB 显存。结果验证框架在显存、运行时间和优化质量方面的效果;语言理解、数学推理和 MT-Bench 评测中,ChunkFT 持续优于现有显存高效基线,部分设置达到或超过常规全参数微调的表现。代码:https://github.com/misonsky/chunk。