HyperVis:用于组合推理的洛伦兹双曲面上的连续潜在视觉关系图
HyperVis: Continuous Latent Visual Relational Graphs on the Lorentz Hyperboloid for Compositional Reasoning
摘要
视觉语言模型 (VLM) 难以进行需要理解对象间关系的组合推理。一种自然的补救措施是从现成的场景图生成器 (SGG) 中注入显式场景图三元组 $\langle s, p, o \rangle$,但我们发现这适得其反:离散文本标签与连续视觉模态发生冲突,将 GQA 准确度从 60.38\% 降低到 58.86\%。我们提出 \textbf{HyperVis},它完全绕过 SGG 语义瓶颈。从 $N$ 类不可知的区域提案中,我们通过空间偏置交叉注意力计算密集的 $O(N^2)$ 视觉关系张量,将其投影到洛伦兹双曲面上,并通过空间物理强制执行层次结构,即 IoA 驱动的蕴涵锥和外角排斥。我们发现 HyperVis 以两种互补的方式做出贡献:(1)作为 \emph{训练时间正则化器},双曲关系损失塑造了 LoRA 表示,从而改善了生成 VQA(对于没有关系损失的 LoRA 微调,GQA 61.03\% vs.\ 57.21\%,恢复并超越了基线); (2) 作为 \emph{推理时间关系编码器},双曲线前缀标记提高了判别性成分评分(SugarCrepe 79.94\%,超过基线 $+$6.25pp)。学习到的曲率稳定在 $κ{=}4.0$,比之前的双曲 VLM 高出一个数量级,其中 $κ$ 通常会向零塌陷,这表明连续视觉特征确实需要强弯曲空间的指数体积。受控的欧几里德消融证实了这种分解:关系管道在平坦空间中对 LoRA 进行了比较正则化(GQA 60.81\%),但组合性增益特别是双曲线(SugarCrepe $+$4.58pp 超过欧几里德),在欧几里德训练中蕴涵损失 ${\sim}6{\times}$ 更高。代码可在 TBA 获取。