论文
能小到什么程度?60M参数模型上Text-to-SQL的LoRA秩、目标模块与量化权衡受控研究
How Small Can You Go? A Controlled Study of LoRA Rank, Target Modules, and Quantization Trade-offs for Text-to-SQL on a 60M-Parameter Model
摘要
参数高效微调(PEFT)与低比特量化已成为在紧张算力预算下适配语言模型的标准工具,但两者的交互大多在十亿参数级模型上研究,而那里的设计空间探索代价高昂。我们提出一个互补的问题:在一个特定、完全可复现的60M参数编码器-解码器模型(T5-small)与单表text-to-SQL基准(WikiSQL)上,每个效率旋钮实际付出多少任务精度代价?我们对以下因素开展受控的单变量研究:(i)LoRA秩 r(取值{2, 4, 8, 16, 32})、(ii)被适配的模块集合、(iii)数值精度。我们在报告任务精度之外还报告系统级指标,包括可训练参数量、峰值训练内存、推理延迟与吞吐量,并将适配视为受约束的权衡而非仅以精度为目标。结果显示,r=16的LoRA达到与全量微调相差11.6个百分点以内的精度(59.6% vs. 71.2% 精确匹配),同时训练参数不足1%、峰值GPU内存减少31%。在该设置下,秩超过r=16不再带来可测量的精度增益。采用INT8与NF4量化的QLoRA以显著更低的内存成本(各0.60 GB)取得可比精度(52.8%与53.2%),展示了面向内存受限部署的诱人权衡。全部代码、配置与日志均已发布以实现完全可复现。
