火山引擎以Prometheus统一观测Agent与模型调用
概述
文中明确托管 Prometheus(VMP)已在火山引擎内部大规模落地:全栈可观测平台把 Agent 运行时指标、大模型调用行为、Token 成本等数据,与集群和业务指标统一接入 VMP,用同一套 Prometheus 采集和查询体系管理,使基础设施、业务服务与智能体运行过程实现端到端观测与联动排障。 这些一线实战经验被直接沉淀为 VMP 对外提供的能力。并用三类读写压测量化收益:不同采集规模下(100 Targets 约 1.2 万 samples/s、日写 11.3 亿点;500 Targets 约 4.1 万 samples/s、日写 38 亿点;1000 Targets)对 VMP 与开源 Prometheus v3.8.0 对比,结论是开源 Prometheus 在 500 targets 规模下开始出现部分请求失败、1000 targets 下即便 64C/128G 也在约 6 小时后达到性能上限且区间查询基本不可用,而 VMP 保持成功率高、延迟更低。 KSM 大盘(255 节点、7800+ Pods、采集超 7 天、42 个加载请求)平均加载延迟 24h 约 3s vs 约 11s(快约 3.7 倍)、48h 约 5.7s vs 约 16s(快约 2.8 倍)、7d 约 13s vs 约 28s(快约 2.2 倍)。Histogram 分位数查询在约 3.2 万/10 万/160 万/320 万原始序列档位上,开源 Prometheus 自 10 万序列 6h/12h 起查询失败、320 万序列即时与区间查询均失败,VMP 分别为约 1.5s/7.0s、约 24s/27s 且均可返回。 成本侧以约 300 Pod、活跃序列约 6 万、15 秒采集、每天 3.5 亿点(月写入 100 亿+)的中等集群测算:VMP 按月写基础指标 200 亿+自定义指标 100 亿、存储 30d、资源包 vmp_month_small_30d 计约 1999 元/月。自建 Prometheus+Alertmanager+EBS 方案约 3280 元/月,另需约 2 人天/月 SRE/DevOps 人力。 总结口径为 VMP 查询延迟通常比自建快 2 倍以上、总体拥有成本约为自建的 50%–60%。