论文

Akashic:带MemAttention的低开销LLM推理服务

Akashic: A Low-Overhead LLM Inference Service with MemAttention

AI 基础设施上下文与知识记忆推理服务Agent记忆

摘要

近期基于LLM的智能体系统跨多轮交互、工具调用与跨会话工作流持续累积上下文。为每个请求重放全史很快不切实际:长上下文增加prefill成本、可能超上下文限制、且常把任务相关证据埋进无关内容——损害serving效率与输出质量。我们提出Akashic:围绕MemAttention构建的低开销记忆系统——把上下文组织为有界块、建模跨块语义关系,保留跨块证据而不反复重写全史。Akashic进一步应用软硬件协同设计的记忆放置:把可能共同检索的块共置,降低检索碎片与I/O开销。跨四个代表性工作负载与三个模型规模:Akashic相较强记忆基线把任务准确率提升最多10.2分、吞吐提升最高1.21倍、可持续请求速率提升最高1.88倍。

Akashic:带MemAttention的低开销LLM推理服务:论文配图
图 1.(a) 现有的内存设计在任务质量/服务效率权衡中占据不同的位置,而阿卡什的目标是高质量、高效率的机制。 (b) 在使用 OPT-30B 的 BrowseComp 上,Akashic 提高了所有基线的准确性和吞吐量,在准确性方面比最强的现有方法高出约 2.0 个点,在吞吐量方面优于约 1.35×\times。