论文
云原生评估即服务:具有保形保证的可扩展人工智能监控的微服务架构
Cloud-Native Evaluation-as-a-Service: A Microservices Architecture for Scalable AI Monitoring with Conformal Guarantees
摘要
我们提出了 EaaS,这是一种云原生参考架构,它将 AI 评估方法作为六种无状态 Kubernetes 微服务进行操作:使用有限样本校正自适应预测集进行保形预测、校准评估、通过 RFF 近似最大平均差异进行漂移检测、使用引导置信区间进行公平性监控、基于 DAG 的管道编排器以及结果存储 API。我们验证了四个关键的方法论问题。首先,经验覆盖率与 K=50 随机校准/测试分割的边际保形保证一致,平均覆盖率在标称目标的 1.4 个百分点以内。其次,所有四个 MMLU 答案标记均出现在前 20 个对数概率中,需要 0% 插补,而 10% 的模拟插补产生的覆盖率影响低于 1.5%。第三,RFF-MMD 在中值启发式带宽下实现了对轻度和严重漂移的 100% 检测能力,I 类误差在 5-8.5% 之间。第四,对 UCI 成人收入数据集的公平性监测显示,不同种族之间存在显着的人口均等差异(DP 差距 = 0.33),并且连续批次的警报保持稳定。保形预测和校准服务在批量大小 100 时实现低于 2 毫秒的 p99 延迟; RFF-MMD 需要约 500 毫秒,适合定期批量监控。与四种开源工具的比较表明,据我们所知,当前没有平台将保形预测即服务、微服务分解和基于 DAG 的编排结合在一起。