论文
Akashic:带MemAttention的低开销LLM推理服务
Akashic: A Low-Overhead LLM Inference Service with MemAttention
摘要
近期基于LLM的智能体系统跨多轮交互、工具调用与跨会话工作流持续累积上下文。为每个请求重放全史很快不切实际:长上下文增加prefill成本、可能超上下文限制、且常把任务相关证据埋进无关内容——损害serving效率与输出质量。我们提出Akashic:围绕MemAttention构建的低开销记忆系统——把上下文组织为有界块、建模跨块语义关系,保留跨块证据而不反复重写全史。Akashic进一步应用软硬件协同设计的记忆放置:把可能共同检索的块共置,降低检索碎片与I/O开销。跨四个代表性工作负载与三个模型规模:Akashic相较强记忆基线把任务准确率提升最多10.2分、吞吐提升最高1.21倍、可持续请求速率提升最高1.88倍。
