论文

成本治理RAG:多租户LLM系统中检索与生成的统一逐租户成本归因

Cost-Governed RAG: Unified Per-Tenant Cost Attribution Across Retrieval and Generation in Multi-Tenant LLM Systems

AI 基础设施可观测性

摘要

企业检索增强生成(RAG)部署面临关键治理缺口:LLM生成成本按token计量,而检索层——向量内存、相似度计算与嵌入API调用——仍是无归因的共享成本,使租户间出现隐性交叉补贴。我们提出Cost-Governed RAG:一种把免码本向量索引(TurboVec)与多租户LLM治理网关集成的架构——创建嵌入、检索与生成成本可逐租户联合归因的统一可观测栈。该架构利用TurboVec确定性的闭式内存公式实现近精确的逐租户检索成本计算——这一属性是基于图的索引(非线性内存开销)所不具备的。部署在云数据平台治理边界内的Snowpark Container Services上:系统跨100个模拟租户(1,000万向量、对数正态规模分布)取得99.96%的端到端成本归因准确率,遥测开销低于查询延迟的0.04%。在第IV节详述的定价假设下:相较托管向量数据库服务,该架构把检索基础设施成本降低3.1–9.0倍。我们形式化三层成本模型,并证明免码本量化在使能确定性逐租户成本归因的同时,消除训练式量化器存在的共享码本泄漏面——后一观察为探索性并受第VII节局限约束。