论文

推理工程帕累托图谱:哪些优化占据成本、质量和延迟前沿?

The Inference Engineering Pareto Atlas: Which Optimizations Dominate the Cost, Quality, and Latency Frontier?

模型评测评测方法与指标

摘要

大模型推理优化在不同模型、GPU、提示与质量指标上报告加速,难以比较或组合。我们构建成本、质量和延迟的帕累托图谱,为不同部署约束识别最佳配置。穷举测试不可行,因此测量Qwen2.5-7B-Instruct在vLLM 0.12、L4/A100/H100上的54种配置,以此校准模拟器。模拟器在锚定批量规模复现实测,跨实验活动漂移低于1.5%。独立质量评估在200道GSM8K题上,每提示五个示例,测试FP16、AWQ 4位、FP8权重及FP8 KV缓存;稀疏注意力仅在模拟中评估。校准网格中36种配置有18种到达帕累托前沿,组合方法比例更高:15种组合中9种,21种单独方法中9种。质量测试改变了优胜者。AWQ 4位在L4上把每token延迟降至基线0.34倍,却损失5.9%的严格GSM8K准确率,在采样不确定性范围内略低于95%质量底线。灵活答案提取则达到FP16准确率,提示损失来自格式而非算术。FP8权重保留基线99.4%的准确率,在三类GPU上延迟为基线0.61—0.65倍,出现在四种运行条件优胜配置中的三种。朴素FP8 KV缓存吞吐正常,却200题全错,说明只看速度不够。两种提示设计下,n-gram推测解码速度测量为基线0.90—0.98倍,在此栈无额外收益。最佳选择取决于约束和GPU:严格延迟下H100胜出,吞吐和低成本下A100胜出,成本为每百万token 0.106美元。

推理工程帕累托图谱:哪些优化占据成本、质量和延迟前沿?:论文配图
图1:研究总览。(1)许多独立加速结果采用不兼容设置,难以比较或组合。(2)实践者在固定成本、质量或延迟约束下,需要知道哪种优化及组合占优。(3)研究将方法及有潜力的组合放入共同的成本—质量—延迟坐标,计算帕累托前沿,建立各运行区间的优势配置图谱。