论文

Scale-QLoRA:用于本机 4 位微缩放的代码不变适配器合并 LLM

Scale-QLoRA: Code-Invariant Adapter Merging for Native 4-bit Microscaling LLMs

模型训练参数高效训练

摘要

将 LoRA 适配器合并到其基本模型中是标准部署实践:它消除了运行时适配器的每次转发开销,并留下任何服务堆栈都可以加载的单个独立检查点。在本机 4 位微缩放检查点(NVFP4、MXFP4)上,该步骤不再是免费的。合并的权重必须通过量化器写回,量化器重新导出检查点的离散 E2M1 代码平面(大约占工件字节的 90%),因此部署的工件会耦合到一个量化约定,并且其生命周期中的每个后续代码接触事件都可以移动它。天真地完成该步骤比脆弱更糟糕:它删除了最多 39 pp 的适应,因为针对已经在网格上的基础,重建最佳值就是该基础。相反,Scale-QLoRA 仅适应本机每块规模字段,在部署网格上训练这些规模,并冻结每个 E2M1 代码。在固定的本机格式、比例网格、块布局和代码平面内,合并是位精确的身份,并且合并的工件是代码不变的。在四个模型和四个任务中,Scale-QLoRA 和合并感知 QAT-LoRA 都是精度无损的,因此我们声称它们之间没有精度排序;它们在结构上有所不同,因为 QAT-LoRA 通过量化器重新导出代码平面,而 Scale-QLoRA 则准确地保留它。这种差异就是生命周期的代价:最接近的舍入实现在测量的任务上存在大约一个点的差异,并且更极端的规则不匹配可以将权重空间伪影驱动到~0%,我们将其报告为敏感度界限而不是部署频率。保留代码平面还可以从训练中删除权重空间直通估计器(在密集 8B 模型上每步 3.9 倍),并实现精确回滚、代码平面重复数据删除以及速度约 125 倍的仅缩放任务交换。