论文

受限显存下的长上下文微调

Long-Context Fine-Tuning with Limited VRAM

模型架构Transformer

摘要

参数高效微调降低模型与优化器内存,但稠密注意力仍使长训练序列昂贵。我们结合层级全局注意力(HGA)与分段反向传播及分层KV存储:只有活动段在显存中保持可微;更旧的KV被解耦到内存或NVMe,HGA为每个查询块加载有界的精确历史token。在4位QLoRA的Qwen3-8B与PG19上:16GB Quadro RTX 5000上稠密训练塞下2,048 token但在4,096失败,而HGA以15.28GB峰值显存达到16,384 token。评估时同一适配器在该卡上跑通131,072 token;显存非常数而是随驻留块摘要温和增长——超出这些长度后实际限制由内存与NVMe容量决定。在共享2K训练长度下:HGA训练与稠密训练的适配器在同一稠密注意力读出下取得2.7405与2.7383 nat,原版模型2.9541。在该边界HGA训练已边际更快(217.75对207.02 token/s),且HGA对稠密的吞吐比从1K到2K改善;因为HGA保持每token被注意的历史集近似恒定而稠密每token工作量增长,我们预期该领先随上下文增长扩大。主质量与检索比较使用稠密注意力——度量所学权重并与标准生成框架兼容。HGA也可用于检索与生成;优化的生产级serving实现在开发中。