论文

Loopy:循环语言模型的低位量化框架

Loopy: Low-Bit Quantization Framework for Looped Language Models

摘要

循环语言模型提供了一种参数高效方法,通过重复执行共享循环核心来扩展迭代测试时计算。 后训练量化 (PTQ) 可以减少记忆占用空间和循环语言模型的推理成本,但量化共享核心引入的错误会影响后续核心。在 PTQ 方法中,通道缩放和正交旋转保留了浮点计算,同时生成具有不同量化质量的表示。我们发现量化配置候选排名可以随着循环深度的变化而变化,从而激励目标部署深度的配置选择。然而,在这个深度的完整校准集上评估每个候选者的成本很高。因此,我们提出了 Loopy,这是一个 PTQ 框架,它通过循环深度感知目标制定共享核心量化,根据目标部署深度的最终预测损失来选择共享低位表示。通道缩放和正交旋转参数化候选表示。为了有效地近似解决这个选择问题,Loopy 逐步将校准窗口分配给有前途的候选者,同时仅使用前向评估来保留完整的目标深度执行。在八个设置中,Loopy 在不同基线中实现了最先进的结果。在 W4A4 下的 Ouro-1.4B 上,Loopy 相对于 SpinQuant 将 LAMBADA 困惑度降低了 36.5%。我们的代码可在 https://github.com/Shameless0817/Loopy-review.git. 获取

Loopy:循环语言模型的低位量化框架的原论文方法或结果图
图 2:Loopy 方法概述。顶部:通道缩放和旋转定义了在循环步骤之间共享的量化表示。底部:渐进式选择为幸存候选者分配更多校准窗口,同时保留目标深度 $T$。