论文
用小语言模型普及AI:面向本地部署的结构化基准与参数高效微调
Democratizing AI with Small Language Models: Structured Benchmarking and Parameter-Efficient Fine-Tuning for Local Deployment
摘要
AI普及化首先不是匹配前沿规模通用性的问题,而是能力足够的模型能否在普通机构真正满足的硬件与治理约束下被选择、审计与专精化的问题。本文通过对九个1.35亿至30亿参数的开放权重语言模型的受控评估研究该问题,基准含1,085个样例、16个主题的选择题,面向结构化本地部署设计,强调符号精确、受约束格式、抽取与短程语义决策,并采用严格的单字母输出协议。随后用共享的参数高效微调管线,在NVIDIA L4级预算上以4位NF4量化加DoRA/LoRA式适配器微调其中一部分模型。基础评估中,Qwen Coder 3B以75.67%严格准确率领先,其后是Qwen2.5 1.5B的67.10%、Qwen3.5 2B的64.98%与Granite 3.3 2B的64.61%。在共享的108例留出微调划分上,适配使Qwen Coder 3B提升26.85分、SmolLM2 1.7B提升25.92、Qwen2.5 1.5B提升19.44、SmolLM2 360M提升10.18、SmolLM2 135M提升5.55。横跨排名、主题级异质性、难度分层、失败构成、效率前沿与主题条件迁移,同一结论反复出现:基准构建、跨模型评估与低成本专精化的规范流程,已经能让一部分30亿以下参数模型在结构化细分工作负载中胜任本地专家。
