论文
用于组织病理学中稳健视觉上下文学习的几何感知不确定性核心集
Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology
摘要
视觉语言模型(VLM)可以将视觉感知与开放式临床推理结合起来,这使得它们对计算组织病理学具有吸引力。然而,微调 稀缺的、专家注释的病理数据上的数十亿个参数是令人望而却步的,而上下文学习 (ICL) 是在没有参数更新的情况下以示范性图像文本对为条件的 VLM,它对选择哪些示例以及查询的措辞方式高度敏感,从而产生不可靠的诊断。现有的选择策略依赖于查询相关的最近邻检索,该检索忽略全局数据结构,需要昂贵的参数更新,或者忽略 VLM 的联合视觉-文本嵌入几何结构。我们提出了 GAUC,一种直接在预训练的多模态嵌入空间中运行的 无需训练 核心集选择方法。 GAUC 联合优化了三个目标:(1) 最大平均差异项,强制核心集和完整数据集之间的分布保真度;(2) 通过利用 VLM 的联合视觉文本对齐,有效的互信息差异正则化器限制提示释义下的性能下降;(3) 预测不确定性(熵)惩罚,抑制矛盾的、容易产生幻觉的输出。在跨多个开源 VLM 架构的 CRC-100K 和 MHIST 上,GAUC \emph{匹配}最强 ICL 选择和数据集 蒸馏 基线的准确性,同时显着提高校准、提示鲁棒性和幻觉率,所有这些都无需单个梯度更新。