论文

通过GGUF元数据预测单序列llama.cpp在三个系统中的吞吐量

GGUF-Metadata Prediction of Single-Sequence llama.cpp Throughput Across Three Systems

AI 基础设施模型部署

摘要

我们利用具有量化特定缩放因子的Roofline形状的预测器,从GGUF元数据预测单序列模型吞吐量,这些缩放因子在参考模型上进行拟合。测试集包含来自两个Apple M4 Max系统和一台NVIDIA RTX 5080的53个主机文件配置的318个阶段深度测量值。在分别含四个、五个和两个配置的主机专属留出集上,活跃参数解码模型的平均绝对百分比误差(MAPE)分别为13.1%、14.4%和36.1%,而全参数计数方法的MAPE分别为49.4%、55.3%和51.9%。在另外两个系统上使用留一主机验证的系数,测试MAPE分别为11.6%、16.8%和36.0%。低比特模型梯度在不同运行栈中排序发生变化。P2预填充基线的测试MAPE分别为18.7%、22.2%和108.2%。GGUF结构在三个系统中均有效,但拟合效率并非普适。