论文
一图胜千token:视觉语言模型如何在提升精度的同时降低AI能耗
A Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving Accuracy
摘要
LLM推理占AI运行能耗的90%以上,且随输入token数量直接增长——这对电信网络分析与数值时序数据分析(NTSDA)构成关键低效:来自4G/5G基站的原始多变量KPI窗口会展开成数千个浮点token。视觉语言模型(VLM)通过将时序编码为二维图表来消除这种不匹配,在Llama-3.2-90B、Qwen2.5-VL-72B和Pixtral-12B三种架构上实现3.6-10.4倍的输入token缩减。这转化为实测1.8-2.5倍的推理能耗降低,对于每15分钟监测200个小区的电信边缘部署与CloudRAN,每天约节省7.2 MJ。关键的是,效率提升并未牺牲精度:微调后的Llama-3.2-90B-Vision VLM精度比其纯文本对应版本高220.7%,并在电信异常检测上以超过144%的幅度优于LSTM和ARIMA基线。在公开基准上,Pixtral-12B在mean F1 = 0.82下实现J/F1分数20.6倍的提升。当达到24个KPI时,文本表示会超出多数生产级LLM的128K上下文窗口,使纯文本处理不截断即不可行,而视觉表示仍在标准限制之内。这些结果确立了VLM作为数值时序工作负载上兼具能效与精度优势的模态,为将能耗视为一等工程约束的AI推理系统提供了实证依据。
