论文

大模型上小设备:边缘AI部署的最新进展与实证分析

Large Models for Small Devices: Recent Advances and Empirical Analysis of Edge AI Deployment

AI 基础设施模型部署

摘要

在资源受限的边缘设备上运行大型AI模型需要模型压缩来降低模型尺寸与计算量,但压缩效果好的方案未必部署效果好。我们调研了数十篇在真实硬件上报告压缩结果的新近工作,并从中提炼出实用的部署指南。遵循这些指南,我们在GPU、CPU与树莓派平台上、跨问答与图像分割任务部署了紧凑的语言与图像模型。没有任何单一技术在所有任务上胜出。对问答而言,Qwen3.5 0.8B在Q5_K_M GGUF量化下达到93.85 SQuAD F1与92 EM,而同等精度下的结构化剪枝在1%比例就损失16 F1。对分割而言,排序反转:默认量化不改变参数量与MACs,而剪枝在mIoU几乎不变的条件下将模型尺寸削减近80%。剪枝甚至会因破坏k-quant超块对齐而使部署产物膨胀21-49%;叠加更长、格式合规度更低的输出,这会使树莓派延迟最高达3.4倍。压缩还可能制造出看似有能力的表象而非可见地摧毁能力:一个LoRA恢复的变体保持完全可解析并保住71%的严格BoolQ准确率,却把100个预测中的97个都送进同一个类别,平衡准确率仅52.6%。我们通过神经流图分析与prefill-decode级延迟分解解释这些效应,并将其凝练为面向任务的部署研究方向。正确的技术选择取决于任务、模型与硬件。我们的实验代码与产物开源于 https://github.com/Arnavvvkumar/deployment 。

大模型上小设备:边缘AI部署的最新进展与实证分析:论文配图
图5. 从 prefill/decode 视角解释结构化剪枝为何可能拖慢边缘推理。端到端延迟分为一次性的计算受限 prefill 和逐 token 的内存带宽受限 decode;由于 k-quant 回退使可部署权重的字节数膨胀(从 508 MB 到 612 MB),decode 在 N_gen 个输出 token 的每一个上都要重新读取更大的权重集合。实测的阶段变化见表9。