论文

GeoFlowVLM:冻结视觉语言嵌入的几何感知联合不确定性

GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding

模型评测鲁棒性、公平性与可信度评测

摘要

标准双编码器视觉语言模型通过 $\ell_2$ 归一化将图像和文本映射到共享单元超球面上的确定性点,通常既不会暴露出任意不确定性(跨模态模糊性),也不会暴露出认知不确定性(缺乏训练分布支持)。现有的事后方法要么最多恢复两个不确定性分量之一,要么忽略这些模型嵌入的超球面几何形状。我们提出 \textbf{GeoFlowVLM} 作为事后适配器,通过黎曼流与单个掩蔽速度场匹配来学习乘积超球面 $\mathbb{S}^{d-1} \times \mathbb{S}^{d-1}$ 上配对 $\ell_2$ 归一化双编码器 VLM 嵌入的联合分布。一致性结果表明,在群体限制下,训练后的网络将联合流和两个跨模态条件流暴露为各自域上的有效黎曼流匹配速度场。我们从这个单一模型中得出两个量:一个是条件检索熵,它通过 Fano 型界限的决策理论解释来量化任意模糊性,另一个是通过联合 NLL 的精确链规则分解来证明边际典型性认知得分。这种分解分离出一个跨模态的逐点互信息项,该项在结构上是区分性的,而不是认知性的,并且在经验上是唯一始终不提供信息的独立组件。根据经验,熵在两个方向上的三个检索基准上以近乎理想的单调校准来跟踪 Recall@1,并且边际典型性总和在四个零样本分类基准上产生一致校准的选择性精度。