论文
ScaleSim:基于调用距离内存管理的大规模多智能体仿真服务系统
ScaleSim: Serving Large-Scale Multi-Agent Simulation with Invocation Distance-Based Memory Management
摘要
基于LLM的多智能体仿真在各个应用领域越来越多地被采用,但由于GPU内存压力而难以扩展。每个智能体维护私有的GPU驻留状态,包括模型、前缀缓存和适配器,随着智能体数量增长迅速耗尽设备内存。我们识别出这些工作负载的两个关键特性:稀疏的智能体激活和可估计的智能体调用顺序。基于对代表性工作负载类的分析,我们引入调用距离(invocation distance),一个估计智能体发出未来LLM请求相对顺序的统一抽象。利用该抽象,我们提出ScaleSim,一个面向大规模多智能体仿真的高内存效率LLM服务系统。ScaleSim支持主动预取和基于优先级的逐出,通过模块化接口支持多样的智能体专属内存,并在仿真基准上相较SGLang实现最高1.74倍加速。
