APMPlus「生产指标」:日志转指标与链路转指标两条路径,AI 场景可产出调用成功率、P95 推理时延与 Token 成本
从监控盲区到业务洞察:深入解读 APMPlus 生产指标
概述
APMPlus「生产指标」把原始观测数据动态提炼为反映业务健康的业务指标,提供两条转化路径:日志转指标(适用于仅有日志缺量化手段的场景,把访问日志中的页面访问量、错误日志占比,订单日志中的下单成功率、取消原因分布等实时转化为结构化指标);链路转指标(把满足条件的 Span 按服务名、接口名、状态码甚至「是否为 AI 应用」等维度筛选后转为指标,可产出服务间调用成功率、下游依赖错误率、关键链路 P95 响应时长)。实现上要求应用已通过 apmplus-opentelemetry-collector 上报日志或链路并在规则中配置过滤条件(日志级别、服务名、关键字)、字段提取与聚合函数,无需改代码或重新上报。六项能力亮点:日志/链路统一作为数据源;数十种维度高维过滤与白/黑名单;通过正则或边界符做字段提取并支持值翻译归一化(如状态码 200 翻译为 Success);规则异步下发至采集端、最长 5 分钟更新一次且无需重启服务,可与告警联动实现秒级感知;无缝对接自定义看板与告警;规则可应用于账户下所有集群或指定集群,保证多集群监控口径一致。AI 观测场景示例:从 Span 中通过过滤 status_code 与 COUNT 聚合产出 LLM 调用成功率,提取 duration_microseconds 用 PCT95 聚合产出 P95 推理时延,提取 gen_ai.usage.output_tokens 结合 SUM 与计费模型估算 Token 成本。其他已披露用法:数据库慢 SQL 洞察(前置过滤 db.system=mysql 且 duration_microseconds>500000,提取 db.statement、db.sql.table、sql_pattern,产出慢 SQL 比率、P95/P99 执行时长与 TopN 慢语句慢表)、大促 SLO(跨集群统一生产、白名单缩维、值翻译统一成功失败口径)、微服务定位(慢请求占比取 duration>500ms 的 Span、错误拓扑热区聚合上下游服务对、关键路径瓶颈指标)。