论文

企业 编码智能体 的推理经济学:云与本地 LLM 的案例研究

Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs

模型评测模型能力评测

摘要

自治 编码智能体 迫使工程组织在基于 API 的前沿模型(高词元成本下的强推理)和本地量化开放权重模型之间进行选择,后者承诺低边际成本扩展和数据主权,但会损失一些推理保真度。我们通过单一开发人员、非随机纵向案例研究来研究这种权衡,在生产单一存储库上进行两个连续 28 天的时间段:使用 Claude Code 的基于 API 的 Claude Opus 4.7/4.8 配置与使用 Opencode 的本地 GLM-5.1/5.2 配置(在 NVIDIA Blackwell 硬件上量化为 NVFP4)。分析 LLM 遥测和 Git 历史记录,我们发现即时缓存(99.3% 的命中率)将实现的 API 成本降低了 88.6%,有效达到每百万词元 0.57 美元——甚至低于共享本地切片的 2.83 美元摊销单位成本(依赖于利用率的反转;总实现支出和总拥有成本 (TCO) 是稳健的数量)。在相当的总代码改动量下,本地配置与更高的缺陷修复负担相关:修复提交率 (FCR) 分别为 74.9% 和 45.9%,每个难度层中提交修复的几率高出 2.6 到 4.9 倍(Mantel-Haenszel OR = 3.61)。在台湾市场参数和对称劳动力模型下,本地部署在共享 GPU 分配下仍可节省 40.1% 的真实 TCO,而专用预留成本比缓存 API 高 43.8%。在共享分配下,真正的惩罚不是金钱上的,而是可衡量的开发人员体验负担 - 时间戳指标显示更多的工作陷入调试螺旋和较慢的提交节奏 - 离线重放显示混合路由网关沿着成本质量前沿交易缺陷率以节省基础设施,而不是主导纯 API 基线。