论文

可持续性不是线性的:量化设备智能中的性能、能源和隐私权衡

Sustainability Is Not Linear: Quantifying Performance, Energy, and Privacy Trade-offs in On-Device Intelligence

模型评测模型能力评测

摘要

大语言模型(LLM)从云集群到边缘设备的迁移有望增强隐私和离线可访问性,但这种转变遇到了严酷的现实:移动电池的物理限制、热量限制,以及最重要的内存限制。为了应对这种情况,我们构建了一个可复制和可重现的实验管道,以分析移动设备上 LLM 的能耗、延迟和质量之间复杂的相互作用。我们利用该管道在旗舰 Android 设备上进行实证案例研究,捕获 8 个 LLM 的精细指标,范围从 0.5B 到 9B 参数,无需 root 访问权限,确保我们的研究结果反映真实的用户条件。研究结果强调了生成质量、性能、功耗和资源消耗之间的权衡,揭示了 LLM 在不同指标和不同条件下提供最佳平衡。此外,我们发现了一个反直觉的量化能量悖论:虽然现代重要性感知量化成功地减少了内存占用,以将更大的模型装入 RAM,但我们发现与标准混合精度方法相比,它产生的能量节省可以忽略不计。这证明对于电池寿命来说,决定性因素是模型的架构,而不是其量化方案。我们进一步发现,专家混合 (MoE) 架构违背了标准尺寸能量趋势,提供了 7B 模型的存储容量,同时保持了 1B 到 2B 模型的较低能量分布。最后,对这些多目标权衡的分析揭示了 Qwen2.5-3B 等中型模型的实用最佳点,它可以有效地平衡响应质量与可持续能源消耗。