论文

边缘AI语言模型的三重底线可持续性:小语言模型与量化大语言模型的比较

Triple-Bottom-Line Sustainability of Language Models for Edge AI: A Comparison Between SLMs and Quantized LLMs

模型评测评测方法与指标

摘要

边缘人工智能模型选择通常由一个独立的指标驱动——准确性、延迟、内存、能量或安全性,尽管可部署的语言模型必须平衡所有五个指标。我们的工作重点是回答本地训练的小语言模型(SLM)或通过训练后量化压缩的大语言模型(LLM)是否提供更可持续的边缘部署权衡的问题。我们引入了一个可重复的整体可持续性评分 (HSS),围绕三重底线组织:能力和系统效率的经济支柱、GPU 运行能量的环境支柱以及有害提示鲁棒性的社会支柱。不同量化方法下的五个 BF16 SLM 和五个 LLM - BF16、INT8、NF4 4 位、GPTQ 4 位和 GGUF Q4 产生 30 个测量配置。根据五个零样本基准评估能力;效率使用延迟、吞吐量、峰值 VRAM 和能量;安全性通过五种有害提示的攻击成功率来近似。 Qwen3-30B-A3B/GGUF Q4 在合并池中排名第一 (93.38),其次是 Mistral-Small-24B/GGUF Q4 (92.40),而 Phi-4-mini/BF16 是该池中排名最高的 SLM (89.49)。因此,原生 SLM 必须是最可持续的边缘选择这一假设并未得到普遍支持。优化的量化 LLM 可以赢得整体胜利,而 SLM 通过降低资源需求保持竞争力。量化是一种系统级选择,而不是单调的精度-效率权衡,HSS 仍然与其比较池和代理定义相关。

边缘AI语言模型的三重底线可持续性:小语言模型与量化大语言模型的比较:论文配图
图1 实验设计。将5个BF16可持续土地管理模型与5个大语言模型家庭相比较,每个家庭都根据5个精确/后端案例进行评估。每个大语言模型到数量连接都表示一个测量的配置。