看是免费,说不是:揭开边缘 VLM 推理中真正的能量瓶颈
Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference
摘要
视觉语言模型 (VLM) 是具体人工智能的感知支柱,但它们在边缘硬件上的能量足迹仍然知之甚少。现有的效率工作主要集中在减少视觉标记,隐含地将视觉处理视为主要的能源成本。我们通过对设备上 VLM 推理进行首次系统性能量分析来推翻这一隐含假设,涵盖三个架构系列的五个模型、四种输入分辨率和两个硬件平台(NVIDIA RTX 3070 和 Jetson Orin NX)。我们的分析得出三个结论。首先,平均推理能力是模型固有的常数,不受输入分辨率、图像复杂性和提示类型的影响,在所有条件下的变化小于 5%。这意味着输入之间的所有能量变化必须源自推理时间的变化,而不是功耗的变化。其次,由于预填充和解码之间的计算限制和内存限制不对称,每个输出词元的挂钟时间比每个输入词元多 11 到 39 倍,这使得输出词元计数成为延迟和能量的主要驱动因素。第三,图像复杂性(以图像中物体的数量来衡量)在相同分辨率下会产生高达 4.1 倍的能量差异。这种变化不是由于视觉处理成本的增加而引起的,而是由于输出长度的差异引起的。这些发现暴露了视觉标记修剪的根本局限性:即使删除所有视觉标记,也最多可以为固定标记模型节省 10% 的总能量。在涵盖 10 亿到 80 亿个参数的模型中,控制输出长度可节省高达 97% 的总能量,并且解码的能量优势在更大的模型规模上变得更强。简而言之,边缘 VLM 推理的真正能量瓶颈不是模型看到了什么,而是它说了多少。代码可在 https://github.com/Junfei-Z/seeing-is-free 获取。