论文

跨模型分歧作为无标签的正确性信号

Cross-Model Disagreement as a Label-Free Correctness Signal

模型推理推理验证与自校正

摘要

在没有真值标签的情况下检测语言模型何时出错,是安全部署面临的一项根本挑战。现有方法依赖模型自身的不确定性——如词元熵或置信度分数——但这些信号在最危险的失败模式上会严重失效:自信的错误,即模型错了却很确定。在本工作中,我们引入跨模型分歧作为正确性指标——一个简单、无需训练的信号,可以不加修改地嵌入现有的生产系统、路由流水线和部署监控基础设施。给定一个模型生成的答案,跨模型分歧通过单次前向传播计算第二个验证模型在读取该答案时的惊讶或不确定程度。既不需要验证模型生成内容,也不需要正确性标签。我们将该原则实例化为跨模型困惑度(CMP)——度量验证模型对生成模型答案词元的惊讶程度——和跨模型熵(CME)——度量验证模型在这些位置的不确定性。在涵盖推理、检索和数学问题求解(MMLU、TriviaQA和GSM8K)的基准上,CMP和CME均优于模型内不确定性基线。在MMLU上,CMP取得平均AUROC 0.75,而模型内熵基线为0.59。这些结果确立了跨模型分歧作为一种实用的、免训练的无标签正确性估计方法,可直接应用于生产语言模型系统的部署监控、模型路由、选择性预测、数据过滤和可扩展监督。