论文

Intel TDX下NVIDIA H100机密GPU推理的基准测试

Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX

AI 基础设施推理服务

摘要

机密计算正成为处理敏感输入或保护专有模型资产的AI推理工作负载的实际部署要求。然而,为GPU加速的大语言模型服务启用机密执行的性能代价是随工作负载而变且运营上重要的。本文在托管于Intel TDX机密实例的单张NVIDIA H100 80GB GPU上,对比标准非机密执行与机密计算模式做基准研究。评估使用两个代表性语言模型——Mistral-7B v0.1与Qwen3-30B-A3B——在递增并发下测量首token时间、端到端请求延迟、每请求token生成吞吐、全局token吞吐与闭环请求吞吐。在固定请求率实验中,机密模式使Mistral-7B的平均TTFT增加21.8%、Qwen3-30B-A3B增加27.8%,全局token吞吐分别下降17.7%与21.1%。在闭环并发实验中,吞吐差距保持在11.5–20.2%区间,但较大模型在机密模式下更早到达饱和拐点。结果表明机密GPU推理可在负载下保持可用吞吐,但容量规划必须同时计入稳定的吞吐惩罚与较大模型更早的饱和行为。

Intel TDX下NVIDIA H100机密GPU推理的基准测试:论文配图
图 1:使用表 2 中的平均值进行固定请求速率 CC 与非 CC 的比较。该图直接显示了测得的 CC 和非 CC 值,而不仅仅是开销百分比。在每个面板中,条形图按型号分组;在每组中,左栏为非 CC,右栏为 CC。对于 TTFT 和请求延迟,越低越好。对于每个请求和全局吞吐量,越高越好。