论文
轻量大语言模型画像
Profiling Lightweight Large Language Models
摘要
轻量大语言模型(LLM)日益在个人电脑上本地部署,并有望在资源受限的边缘与移动环境中扮演越来越重要的角色。在这类设定中,能耗、执行时间与内存占用直接决定实际可用性,但现有LLM效率评估大多依赖参数量或FLOPs等代理描述符,常与任务精度脱钩。本文引入基于PTME的实验框架做精度感知的轻量LLM推理画像:经直接硬件级测量联合测量精度(Precision)、执行时间(Time)、峰值内存(Memory)与能耗(Energy)。方法论应用于在受控桌面平台上、边缘级资源包络下本地执行的一组代表性轻量LLM,基准横跨代码生成、数学推理与多任务理解。我们发现:静态代理描述符能较好近似推理成本,却无法预测精度;收紧资源包络增加成本而不影响精度,对执行时间的放大强于能耗、对更大模型的惩罚最重;且没有单一模型在所有PTME维度占优,帕累托分析揭示会被仅精度或仅效率评估隐藏的非支配配置,为不同资源包络下的模型选择提供实用指导。结果表明:仅按大小、FLOPs、延迟或精度选轻量LLM可能选错部署候选;PTME画像暴露以更低物理成本保持有用精度的配置。