论文
大语言模型 对于行业部署来说经济可行吗?
Are Large Language Models Economically Viable for Industry Deployment?
摘要
由 大语言模型 (LLM) 提供支持的生成式 AI 越来越多地部署在医疗保健决策支持、财务分析、企业检索和对话自动化等行业中,其中可靠性、效率和成本控制至关重要。在这种情况下,模型必须满足对能量、延迟和硬件利用率的严格限制,而不仅仅是准确性。然而,主流的评估流程仍然以准确性为中心,从而造成了部署与评估之间的差距——模型评估中缺乏操作和经济标准。为了弥补这一差距,我们推出了 EDGE-EVAL,这是一种面向行业的基准测试框架,可在传统 NVIDIA Tesla T4 GPU 上评估 LLM 的整个生命周期。我们对三项工业任务中的 LLaMA 和 Qwen 变体进行了基准测试,引入了五个部署指标 - 经济收支平衡 (Nbreak)、每瓦智能 (IPW)、系统密度 (\r{ho}sys)、冷启动税 (Ctax) 和量化保真度 (Qret) - 捕获盈利能力、能源效率、硬件扩展、无服务器可行性和压缩安全性。我们的结果揭示了一个清晰的效率前沿模型,<2B 参数类在经济和生态维度上主导着更大的基线。 LLaMA-3.2-1B (INT4) 在 14 个请求(中值)中实现了 ROI 收支平衡,提供比 7B 模型高 3 倍的能量归一化智能,并在 4 位量化下超过 6,900 个词元/秒/GB。我们进一步发现了一个效率异常现象——虽然 QLoRA 减少了内存占用,但它使小型模型的适应能量提高了 7 倍——挑战了关于边缘部署中量化感知训练的普遍假设。