论文
Intel TDX下NVIDIA H100机密GPU推理的基准测试
Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX
摘要
机密计算正成为处理敏感输入或保护专有模型资产的AI推理工作负载的实际部署要求。然而,为GPU加速的大语言模型服务启用机密执行的性能代价是随工作负载而变且运营上重要的。本文在托管于Intel TDX机密实例的单张NVIDIA H100 80GB GPU上,对比标准非机密执行与机密计算模式做基准研究。评估使用两个代表性语言模型——Mistral-7B v0.1与Qwen3-30B-A3B——在递增并发下测量首token时间、端到端请求延迟、每请求token生成吞吐、全局token吞吐与闭环请求吞吐。在固定请求率实验中,机密模式使Mistral-7B的平均TTFT增加21.8%、Qwen3-30B-A3B增加27.8%,全局token吞吐分别下降17.7%与21.1%。在闭环并发实验中,吞吐差距保持在11.5–20.2%区间,但较大模型在机密模式下更早到达饱和拐点。结果表明机密GPU推理可在负载下保持可用吞吐,但容量规划必须同时计入稳定的吞吐惩罚与较大模型更早的饱和行为。
