论文
SemanticALLI:在Agentic系统中缓存推理而不只是响应
SemanticALLI: Caching Reasoning, Not Just Responses, in Agentic Systems
摘要
Agentic AI 管线存在一个隐藏的低效:即使用户的自然语言表述全新,它们也频繁重建相同的中间逻辑,例如指标归一化或图表脚手架。常规的边界缓存无法捕捉这种低效,因为它把推理视为单体黑盒。我们提出 SemanticALLI,Alli(PMG 的营销情报平台)内的一个管线感知架构,旨在把冗余推理可操作化。通过把生成分解为分析意图解析(AIR)与可视化合成(VS),SemanticALLI 把结构化中间表示(IR)提升为一等、可缓存的产物。在 agentic 循环内缓存的影响可观。在我们的评估中,由于语言差异,基线单体缓存的命中率上限为 38.7%。相比之下,我们的结构化方法使另一个阶段——可视化合成阶段——达到 83.10% 的命中率,绕过 4,023 次 LLM 调用,中位延迟仅 2.66 毫秒。这种内部复用降低总 token 消耗,为 AI 系统设计提供实践教训:即使用户很少重复自己,管线却常常在稳定、结构化的检查点上重复,而那里正是缓存最可靠之处。
