论文

智能体应部署在哪里?边云连续体中的能耗与内存特征

Where Should Agents Live? Energy-Memory Characterization of Agentic AI for the Edge-Cloud Continuum

模型评测评测方法与指标

摘要

电信网络迈向自主5G-Advanced和6G运营时,包含多步推理、诊断工具调用、领域检索与团队协调的智能体AI工作流日益部署于边云连续体。生物大脑以约20W的低代谢功率完成复杂认知,而当代大模型耗能和内存需求很高,使可持续生命周期编排成为运营重点。但现有AI生命周期指标只评估孤立的单模型推理,或完全忽视多智能体执行图,运营商因而缺乏基础模型来判断分布式通信的能耗重要性,以及智能体团队应部署在哪个边云层级。为此,我们提出agentic-eCAL,把AI生命周期能耗指标eCAL推广到有向多智能体工作流,将闭式双速率单调用能耗模型——计算受限的预填充与内存受限的解码——和七层OSI数据传输结合。基于NVIDIA A100和H100上数百种GPU基准配置、16个开放权重模型及8种编排拓扑,我们验证指标组件并研究部署位置影响。结果表明,在5G无线接入、城域及光链路上传输智能体间文本只占工作流能耗的0.25%。因此,边云智能体部署中,分布式执行的主导能耗通常不是文本传输本身,而是通信引发的额外推理与上下文处理。

智能体应部署在哪里?边云连续体中的能耗与内存特征:论文配图
图 7:代理团队适合跨加速器层的位置(等式 1)。 (a) 按权重类别跨 16 个开放权重模型加载模型 (β​Nparams≤Mu\beta N_{\mathrm{params}}\leq M_{u})。 (b) 常驻 KV 缓存上下文 (γ​Σaxa​u​ca≤Mu−β​Nparams\gamma\sum_{a}x_{au}c_{a}\leq M_{u}-\beta N_{\mathrm{params}}) 下的并发服务能力(10 个智能体团队的会话),显示密度由 KV 宽度 γ\gamma 控制。 (c) 八个编排架构的跨团队规模的代理间边缘计数 EE N∈{5,…​30}N\in\{5,...30\}。