论文
多模态临床诊断的排名感知提示优化
Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis
摘要
多模态大语言模型 (MLLM) 正在迅速推进临床诊断,但其适应管道仍然锚定于基于准确性的目标。临床数据严重类别不平衡:恒定多数预测因子的准确率可以达到 90% 以上,但在临床上毫无用处。因此,我们评估并优化 AUROC,这是一种无阈值分数,将积极因素排在消极因素之上,并且不影响类别平衡。我们专注于 MLLM 的即时优化。 GEPA 等反思方法使用二进制分数矩阵,每个评估实例一行,每个候选提示一列;单元格记录每个实例的正确性,因此列平均值是准确性并驱动候选选择。我们引入了配对级帕累托提示进化(Ranking-PE),它将每个正确性行替换为(正、负)实例对上的成对排序行:如果候选者对正数的评分高于配对负数,则单元格为 1。然后,列平均值等于经验 AUROC(通过 Wilcoxon-Mann-Whitney 恒等式)。我们在提示进化搜索读取的所有三层上应用这种交换 - 决定帕累托优势的分数矩阵、反射 LM 的每个示例反馈以及最终候选选择 - 没有额外的模型调用,也没有代理损失。 MIMIC 上的三种疾病中,基于准确性的快速进化可能会降低排名; Ranking-PE 扭转了这一局面,在微调的 Qwen3-VL-8B 上以 +5.8 AUROC pp 击败了基于准确性的配方,在 MedGemma-4B 上击败了 +16.2 pp。 Ablations 检查每个设计组件,并表明医疗级视觉主干(通过视觉编码器调整的 SFT 或医疗预训练)是即时搜索无法取代的先决条件 - 我们的方案将反射式即时进化从纯文本数据扩展到多模态临床决策。