论文

审计非生成 System-1 模型的校准与选项顺序稳定性

Auditing System-1 Models on Biosecurity-Relevant Benchmarks: Calibration, Selective Prediction, and Permutation Instability in a Non-Generative Model

模型评测模型推理判别式推理与决策鲁棒性、公平性与可信度评测

摘要

非生成“System-1”模型在单次前向传递中返回结构化概率决策,无需自回归解码,其推理成本只是生成模型的一小部分。这使得它们作为大型管道中的廉价组件而受到关注,但它们在生物安全相关任务上的可靠性尚未得到系统检验。我们对一个商业 System-1 模型进行了审核,该模型涉及来自大规模杀伤性武器代理 (WMDP)(一种强大的 WMDP-Bio 变体)中的 6,020 个多项选择项目,以及六个 LAB-Bench 子任务,测量准确性、校准、错误检测、选择性预测以及对答案选项呈现顺序的敏感性。准确性很大程度上取决于任务。一旦正确解释了供应商的不确定性字段,模型就会得到相当好的校准(汇总预期校准误差为 0.034),并且其 top-1 概率将正确预测与错误预测分开(汇总 AUROC 0.820),尽管两者在较弱的任务上都会大幅退化。在答案选项的四次循环轮换下,37.4%的WMDP-Cyber​​项目得到了不同的答案;使用字节相同重复调用的控件将大部分归因于选项顺序而不是运行之间的变化。平均轮换概率可将 WMDP-Cyber​​ 准确性提高 3.8 个百分点,并且仅将其应用于低置信度项目即可恢复大部分收益,而成本远低于对每个项目进行平均的成本。