论文
MTServe:使用分层缓存为生成推荐模型提供高效服务
MTServe: Efficient Serving for Generative Recommendation Models with Hierarchical Caches
摘要
生成推荐(GR)提供了卓越的建模能力,但由于长期用户历史的重复编码,推理成本过高。虽然跨请求键值 (KV) 缓存重用提供了重要的优化机会,但大规模的单个用户状态造成了存储爆炸,远远超出了物理 GPU 的限制。我们提出了 MTServe,这是一种分层缓存管理系统,它通过利用主机 RAM 作为可扩展的备份存储来虚拟化 GPU 内存。为了弥合各层之间的 I/O 差距,MTServe 引入了一套系统级优化,包括混合存储布局、异步数据传输管道和局部驱动的替换策略。在公共和生产数据集上,MTServe 均可提供高达 3.1* 的加速,同时保持近乎完美的命中率 (>98.5%)。