论文

CacheSpec:寻找小模型在大语言模型系统中的甜点位

CacheSpec: Finding the Sweet Spot for Small Models in Large Language Models

模型推理推理加速

摘要

大语言模型(LLM)日益用于程序辅助推理、智能体决策与结构化任务执行,但这些设定常带来可观推理成本。许多此类请求共享相似计算结构、仅在变量、约束或上下文上不同,为程序级缓存创造机会。程序缓存需要把可复用计算逻辑重新应用到新请求,其关键步骤常涉及轻量结构化操作——变量抽取、程序绑定与生成加速——非常适合小模型。我们提出CacheSpec,一个以可复用程序缓存为核心的推理优化框架:把思维程序(PoT)式程序从一次性推理工件转变为可复用缓存对象,并让同一个小模型承担两个角色:缓存命中路径上的语义变量抽取、以及目标LLM生成期间的投机草稿。在购物风格请求数据集、WebShop、Formula与CodeTAT-QA上的实验显示:CacheSpec降低推理延迟、提升有效缓存复用,任务质量与既有缓存与生成基线持平或更好,延迟加速最高约3.1倍;并行服务实验中吞吐较PoT式方法提升约2.8倍。结果表明:小模型在大模型推理系统中的甜点位不在独立解决复杂任务,而在执行轻量、结构化、可验证的辅助操作。