论文

评估盲目性:无声测量失败如何破坏人工智能系统从训练到部署的整个过程

Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment

模型评测评测方法与指标

摘要

人工智能系统可能会悄无声息地失败。故障通过训练循环、评估管道和生产监控堆栈传播,直到下游损害变得可见。本文介绍了评估盲目性:当系统实际发生故障时,测量函数 M 产生的读数与健康状态无法区分,并且没有辅助信号标记差距,则测量函数 M 对故障类别 F 表现出评估盲目性。文献分别处理了两个生命周期阶段的问题。在训练时,奖励模型被玩弄,重要性抽样校正被悄悄错误计算,基准污染使 微调 评估膨胀,而损失曲线看起来很健康,梯度更新正常进行。在部署时,监控无法捕获六类生产故障,其中包括根据结构定义 100% 静默的操作类别。我们提供了统一两个阶段的正式可检测性谓词。四个训练时间案例研究追踪了具体的故障,包括 TRL PR #6594 中的一个真正的实现错误,其中梯度随着损失正常减少而被破坏。根据法庭文件和监管文件中的 50 起现实世界事件进行的六类分类法验证发现,53% 的可验证公共失败是沉默的。故障预算框架将可接受的故障率与用例风险类别联系起来。其含义是直接的:测量基础设施是整个人工智能生命周期中的正确性问题,而不仅仅是在评估时。数据、代码和分类架构位于 https://github.com/priyanka25aug/LLM-failure-taxonomy。