论文
当提示忽略结构时:校准 VLM 的基于图的属性推理
When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs
摘要
可靠的置信度估计仍然是视觉语言模型(VLM)测试时适应的一个关键限制,其中及时调整可以提高零样本精度,但由于熵驱动的过度自信,通常会降低校准性能。先前的方法使用 LLM 派生类属性和对比正则化来缓解这种情况,但独立处理属性,忽略它们的关系结构。我们提出 ARGTCA,它将(类、属性)对表示为符号属性图中的节点,并使用对比目标训练图注意网络(GAT),以生成捕获属性间依赖关系的结构知情嵌入。我们引入两种属性选择策略:用于类内多样性的 ARGTCA-DIV 和用于类间区分的 ARGTCA-DISC。跨九个基准测试的实验表明,ARGTCA-DIV 将平均预期校准误差 (ECE) 比基线降低了约 37%,而 ARGTCA-DISC 始终表现第二佳,将平均 ECE 比基线降低了约 17%。这些结果表明,对符号属性交互进行建模为 VLM 中可靠的测试时间自适应提供了原则性方法。