论文

任务条件人工智能模型中的无意识差距忽略了其他可报告的安全关键信号

The inattentional gap in task conditioned AI models that omit otherwise reportable safety critical signals

模型评测安全与风险评测

摘要

放射学和其他安全关键工作流程中的人工智能是根据它被告知要发现的危害进行评估的,但危害不成比例地来自于没有人指定的危害。我们表明,将语言或视觉模型限制在狭窄的任务上会抑制其报告共存的、安全关键的信号,否则它可以报告这种信号,这与人类无意识失明的行为类似。在放射学文本场景和胸部图像视觉任务中,普通的聚焦指令将报告抑制高达 0.92;七个模型中的差距从最小到完全不等,不随规模单调变化,并且在推理模型中持续存在,而一个旗舰模型显示出强大的安全报告覆盖。我们将这种分离称为“疏忽差距”:系统可以对特定危险进行近乎完美的评分,同时忽略同时存在的安全关键危险。在对 24 个场景进行的调查中,一位独立的开放式评审模型恢复了每一个被遗漏的发现。我们建议将报告完整评估作为安全关键型部署的准入标准。