论文

MemBoost:用于成本感知 LLM 推理的内存增强框架

MemBoost: A Memory-Boosted Framework for Cost-Aware LLM Inference

AI 基础设施推理服务

摘要

大语言模型 (LLM) 提供强大的性能,但在实际服务中会产生较高的推理成本,特别是在跨用户和会话重复或接近重复查询的工作负载下。在这项工作中,我们提出了 MemBoost,这是一种内存增强的 LLM 服务框架,它使轻量级模型能够重用以前生成的答案并检索相关支持信息以进行廉价推理,同时有选择地将困难或不确定的查询升级为更强的模型。与主要基于单个响应的标准检索增强生成不同,MemBoost 专为交互式设置而设计,支持答案重用、持续内存增长和成本感知路由。在模拟工作负载下跨多个模型进行的实验表明,MemBoost 大大减少了昂贵的大型模型调用和总体推理成本,同时保持了与强模型基线相当的高答案质量。