论文

不确定性不是临床 VQA 的安全网,但它可以预测模型失败吗?

Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure?

模型评测鲁棒性、公平性与可信度评测

摘要

临床视觉语言模型 (VLM) 的安全部署需要可靠的不确定性估计 (UE):指示何时应信任预测或将预测升级给临床医生的信号。我们测试当前的 UE 方法是否确实传送该信号。对临床视觉问答 (VQA) 上 12 个 VLM 的 8 种方法进行基准测试,我们发现 UE 质量并不是 UE 方法的固有属性:它跟踪模型准确性,精确地降低模型性能最弱的地方,因此最需要可靠性的地方。当我们通过隐藏多项选择答案(NOTA 扰动)中的正确选项来对模型进行压力测试时,准确性会崩溃,而不确定性几乎没有变化,导致模型系统性地校准错误。然而,我们发现未受干扰输入的不确定性可靠地预测了哪些预测将在 NOTA 下崩溃,这表明当前 VLM 中的 UE 携带有关模型脆弱性的诊断信息。我们的结果将 UE 定位为一种诊断工具,用于识别脆弱的预测并激励基于扰动的评估作为安全临床部署的途径。