论文

视觉和语言模型的经验贝叶斯保形预测

Empirical Bayes Conformal Prediction for Vision and Language Models

模型推理推理验证与自校正

摘要

保形预测(CP)为现代视觉和语言模型提供了无分布的覆盖,但它通常被迫根据单个不稳定的不合格分数做出排名决策。标准 CP 使用一种实现,而平均然后校准变体将多种实现平滑为点估计。这两个选项都抛弃了不一致的情况,这有助于确定候选人是否确实稳定。即使证据不强,弱答案也可以进入保形集,仅仅是因为一个后验样本或提示措辞使其看起来很强。但变异性可以帮助区分稳定信号和噪声驱动的波动。我们描述了一个经验贝叶斯保形预测框架,该框架使用 $r$ 值将分数变异性转换为不确定性通知的不合格分数。在考虑了平均分数和不确定性之后,得到的 $r$ 值估计了候选人的潜在分数属于排名最高的组的可能性。它承认封闭式正态-正态经验贝叶斯估计器和非参数后采样估计器。使用 $r$ 值作为不合格分数可以保留目标保形覆盖范围,同时可证明在温和的规律性条件下减少高方差错误候选者的包含。在图像分类、基于 CLIP 的 VLM 基准和 LLM 中,我们表明 $r$ 值保形预测保留了目标覆盖范围,同时在变异性提供信息时提高排名稳定性并减少集合大小,并在变异性消失时恢复到类似 CP 的行为。