论文
量化智能体剖析:代码合成Agentic工作负载中的VRAM稳定性与预测
Anatomy of a Quantized Agent: VRAM Stability and Forecasting in Code-Synthesis Agentic Workloads
摘要
针对LLM推理峰值VRAM消耗的解析模型把内存分解为权重存储、KV缓存和激活项,并以步数、工具调用次数和上下文扩展为参数。我们在一个严格限定范围的测量研究中实证评估这种分解:一个基于LangGraph的CUDA内核合成智能体(AgentK)、一个4比特量化家族(Q4 K M)、单块NVIDIA H100 GPU,以及四个LLM骨干、共1,920条轨迹。聚焦峰值内存预测行为,我们报告两个主要观察。第一,闭式解析模型在提供两个经验常数——已加载权重的VRAM和一个固定激活内存开销——时可达到有竞争力的精度。在提供实时GPU读数和真值轨迹参数时,闭式模型在四个骨干中的三个上匹配或优于最佳学习型基线(测试MAPE 2.2-4.4% vs. 3.4-6.5%,p = 0.76)。例外是最小的骨干(Phi-4-mini):其VRAM方差极小(CV 0.3%),导致动态建模不敌简单回归。第二,编译成功率严格按骨干能力二分(从Phi-4-mini的5.7%到Qwen2.5-Coder-14B的62.0%),说明功能性代码合成仍受LLM内在能力而非可用内存约束。此外,由于所有骨干的整体峰值内存方差都非常低(CV 0.3-9.4%),学习型提示特征回归相对常数均值基线的提升在统计上不显著。因此,我们发现在高度量化、权重主导的机制中没有理由部署复杂的预测性VRAM模型。我们发布所评估的语料库和匿名化框架以支持复现。