论文
不同Agent的资源与性能动态:更多CPU未必更快
Not All AI Agents Are Equal: Characterizing Resource and Performance Dynamics
摘要
基于LLM的AI智能体通过迭代推理与工具执行处理请求,常将远程LLM API与本地工具容器结合。延迟、本地资源需求和容器瓶颈在不同请求间混合,使服务优化困难。然而,当前智能体生态较少考虑资源动态,造成显著资源浪费。本文分析检索增强问答、网页搜索和软件编程三种代表任务的资源混合情况,刻画并发处理多个请求与任务时,延迟和资源动态的关系。测量显示,不同任务的智能体行为差异很大,即使同一个工具也可能具有显著不同的资源动态。并发请求还暴露CPU、磁盘I/O和内存等依赖任务的瓶颈。此外,更快的LLM响应或更多CPU核并不总能加快智能体。基于这些观察,我们展示利用任务资源动态的优化机会:CPU感知的工具准入与任务感知CPU分配。结果表明,相对原生智能体,CPU敏感任务延迟改善约5.4倍,多任务平均延迟减少约32%。