论文
医学视觉语言助手的权威保护评估
Authority-Preserving Evaluation of Medical Vision-Language Assistants
摘要
医学视觉语言模型可以建议应多紧急地审查皮肤病变,但当地服务部门保留根据转诊政策、能力和当地患者情况接受或更换该建议的权力。因此,提案质量和选定行动质量是不同的评估目标,只有当本地审查保留预期行动分数时,基准证据才会在它们之间转移。我们引入了 AuthEval,这是一个日志记录和评估框架,它记录这两种操作,根据声明的本地标准对所选操作进行评分,并且在可行的情况下,根据相同的规则对被拒绝的提案进行评分。只有当记录支持时,它才会报告由此产生的权威差距。因为差距是提案变更率和变更案例的平均分数变化的乘积,所以该比率本身既不能决定其大小,也不能决定其符号。在 ISIC 2019 上,通过 MedGemma 和模拟本地审查,具有相似变化率的两种约束制度产生了乐观的图像 - 容量下的差距相等($+0.744$ 模拟器单位),但在安全下没有可检测到的差距。宣布的评估单位也很重要:在混合约束下,当权重从图像转移到病变感知簇时,差距从 $+0.374$ 逆转为 $-0.206$。因此,AuthEval 澄清了研究记录是否支持有关模型、工作流程或两者的主张。