论文
OmniMed-Jev:通过 System One 校准 LVLM 置信度以实现值得信赖的医疗多模态决策
OmniMed-Jev: Calibrating LVLM Confidence for Trustworthy Medical Multimodal Decisions via System One
摘要
判断医学模型不仅取决于正确性,还取决于报告的置信度是否与实际准确性相匹配。通才多模态医学模型扩展了单个模型可以感知的内容,但它们仍然以生成的文本形式表达有界决策,例如诊断、发现或细胞计数,因此报告的概率反映了下一个标记而不是决策本身。受 Jev 等决策原生接口的推动,我们引入了 OmniMed-Jev,它将每个医疗决策表示为运行时提供的候选集上的 Choice、Noul 或 Score 决策,并返回该集的完整分布:互斥类、结果的二进制存在或有界有序值。该设计在三个方面是全方位的:它接受不同的成像模式,涵盖不同的预测任务,并通过一个候选条件概率模型来表达它们,因此异构输出成为可比较的概率,而不是特定于任务的字符串。在与在相同骨干、数据和时间表上训练的生成基线进行界面控制比较时,OmniMed-Jev 报告的概率更紧密地跟踪观察到的正确性,将校准误差减少多达一个数量级,将可靠性误差减少多达两个数量级,同时点预测性能保持可比性;计数是生成基线保持领先的唯一家庭。使模型输出的决策分布不是格式更改,而是将报告的数字转化为言之有理的概率。这些结果支持明确的决策模型,作为使报告的置信度在评估的任务中有意义的一种方式,并且它们并不是临床准备的证据:比较不能将界面与相关的训练差异分开,我们在结果旁边说明了这一点。代码可在 github.com/lytang63/OmniMed-Jev 获取。