论文

能源盲点:NVIDIA 旗舰边缘 AI 硬件无法支持进程级能源归因

The Energy Blind Spot: NVIDIA's Flagship Edge AI Hardware Cannot Support Process-Level Energy Attribution

AI 基础设施可观测性

摘要

代理人工智能工作负载(单个用户目标触发多步骤编排、工具调用、重试和故障恢复)正在成为边缘部署的目标,NVIDIA、戴尔、惠普、华硕、微星、宏碁和技嘉都将在 2026 年推出基于 GB10 的桌面人工智能系统。之前的研究表明,编排结构主导着代理能源成本,CPU 端处理占总动态能源的比例高达 44%。我们报告了对华硕 Ascent GX10 (GB10 SoC) 的系统能源可观测性审计,发现该平台没有通过任何支持的软件接口暴露 CPU 能源计数器、INA 电源轨监视器、IPMI/BMC 和 SCMI powercap 协议。唯一的设备上能源遥测是通过 NVML 提供的瞬时 GPU 功率。我们进一步发现,MediaTek 固件已经通过未公开的 ACPI 接口 (SPBM) 在内部计算每轨能量,但 NVIDIA 表示“没有计划公开 CPU 轨信息”。因此,设备上每个进程的能量归因(通过 RAPL 在 x86 上执行)无法通过支持的接口在此平台上重现。我们正式制定了能量属性 AI 的硬件要求规范,提出了用于每个域能量分解的临时校准桥(在 CPU 能量累加器处于活动状态的 Acer Veriton GN100 上得到了确认),并通过 SCMI powercap 确定了标准轨道路径。我们的研究结果促使低碳计算社区将能源可观测性作为一流的硬件要求。