技术实践

百度以CPU与GPU机密计算保护AI运行链路

AI 基础设施AI 芯片AI 服务器AI安全与内容治理基础设施

概述

该机型基于第 7 代虚拟机(新款英特尔至强处理器 + BlueField DPU)构建,替代第 6 代仅支持单 GPU、I/O 未卸载因而只适配 7B/13B 小规模推理的方案:CPU 侧用 TDX 建立虚拟机级可信执行环境并配合多密钥全内存加密与远程证明。GPU 侧引入 NVIDIA Protect PCIe 加密模式,把多块 GPU 直通到同一虚拟机并经 NVLink/NVSwitch 构建高速互联集群,消除 CPU 与 GPU 之间明文过 PCIe 总线的边界泄露。 网络与存储 I/O 经 BlueField 的 vDPA(VFE + vhost-vDPA + vhost-user + VFIO,并支持 page-per-vq、host-notifier)全量卸载到 DPU,使 CPU 与内存资源完全交付,同时保留热迁移能力。针对 TDX 下 vDPA notify region 未被标为共享内存导致设备失效的问题,优化 TDVF 固件在启动阶段提前标记并受控处理共享/私有内存。 针对多 GPU 大 BAR(单卡约 64GB)占用 4GB 以上 MMIO 空间导致 notify region 落到高地址、page-per-vq 模式下设备初始化中断的问题,重做内存子区域查找与处理逻辑。可用性为 TDX + GPU CC 双重远程认证、预置环境 + 最新 LTS 驱动 + CUDA 开箱即用。 性能评估:开启 TDX 后内存带宽与延迟几乎与普通虚拟机持平,Virtio 磁盘与网卡绝大多数场景性能损失可忽略,GEMM 类任务性能达成率约 99%,H2D/D2H 带宽因 GPU 型号而异。