论文

确信错误,默默地如此:审核已部署的设备上语言模型的不可检测的故障

Confidently Wrong, Silently So: Auditing Undetectable Failures of a Deployed On-Device Language Model

模型评测鲁棒性、公平性与可信度评测

摘要

协调已部署的语言模型需要知道何时可以信任其输出,但设备上的模型现在已在没有服务器端审核的情况下运送到数亿台设备,并且开发人员实际可以部署的配置很少经过独立审核。我们对开发人员可访问的设备上基础模型进行了可重复的可靠性审核,并提出了一个监督问题:用户或资源有限的开发人员能否判断模型何时错误?在校准、对错误前提问题的自信讨论以及过度拒绝良性提示方面进行红队处理,我们发现了 \emph{任务不对称的错误校准}:它的护栏在跨任务的相反方向上失败(在 69\% 的错误前提上进行讨论,同时拒绝 18\% 完全良性的输入),而自我报告的置信度是饱和的且非歧视性的(AUROC 0.47;ECE) 70,在同类小型型号中最差)。至关重要的是,置信正确和置信错误的输出是 \emph{表面不可区分}:超过 15 个用户可见特征的分类器在 AUROC 上将它们仅分开 0.55(等价性确认),在推理时不留下任何监督信号。没有廉价的单生成信号标记这些故障($\le$0.68 AUROC),而不需要模型访问的黑盒一致性包装器以可调成本恢复可靠性(置信配置 75\%$\to$3\%;选择性精度 43\%$\to$83\%)。我们提供了与模型无关的审计协议、表面不可区分性测试,并发布了代码和冻结的评估项目,作为审计部署模型的可重用基础设施。