论文

解决计算上限:Galahad 中的字节精确内存使 LLM 读取一次性成本 LLM 读取一次性成本

Working Around the Compute Ceiling: Byte-Exact Memory in Galahad Makes LLM Reading a One-Time Cost LLM Reading a One-Time Cost

AI 基础设施推理服务

摘要

Transformer语言模型对每个词元执行的计算量有限,Infosys前CEO Vishal Sikka的近期工作认为,这限制了模型可执行或验证的任务范围(arXiv:2507.07505)。我们研究这一上限之下,有多少计算花在模型已经完成的工作上。跨请求服务通常无状态:模型再次回答同一文档的问题时,仍从首个词元重新计算文档的注意力状态。在七个现实数据集中,98.7%的提示词元来自模型已经读过的文本。我们提出Galahad,为vLLM、SGLang和llama.cpp增加记忆层,将阅读变为一次性成本。Taliesin保存文本块的键值(KV)状态,在后续包含相同字节的请求中加载,而不重新计算;Blaise保存文档本身,只向模型提供问题所需段落。在97,000词元语料中隐藏100条事实的回忆测试(Gemma 4 31B)中,仅使用Taliesin即可让模型关注整个语料,在llama.cpp上答对98题,每题3.0秒、572焦耳;同一模型不使用Galahad时只能容纳最后12,000词元,答对10题,每题9.3秒、2,754焦耳。加入Blaise后,模型每题读取约668词元,在三个运行时均答对100题,每题0.59—0.64秒、200—213焦耳;调优的RAGFlow流程答对77题。存储语料的一次性成本约100秒、28千焦,其能耗在13个问题后抵消。恢复状态逐位一致:重启、状态恢复及热加载后,262,144个输出logit全部一致。Galahad适用于在vLLM下测试的全部30个模型;校验失败时拒绝复用,任何未通过检查的加载均重新计算。这些结果推动LLM服务从无状态向有状态推理转变。