论文
SEER:用于受控空间关系分类的自主定位证据接口
SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification
摘要
空间关系问题需要一个模型在比较布局之前识别所查询的主体和客体。然而,VLM 可以识别这两个实体,并且仍然从错误的实例或模糊的全局视图中进行回答。我们询问明确查询特定证据是否可以缓解这种失败,并提出 SEER(实体关系推理的自主定位证据),这是一种用于冻结 VLM 的 无需训练 推理时间证据接口。 SEER 在配对定位过程中隐藏候选关系,构建具有明确主体/客体角色的查询特定视图,并保留完整图像和稀疏框几何形状作为补充证据。对于具有精确逆向支持的关系选择协议,只有当恰好一个视觉状态服从相应的逆向关系时,可选的细化才会交换实体角色并更改前向决策。在模型评分之前冻结的图像不相交 GQA-Train900 测试中,SEER 池比 Full 达到 +3.94 [2.17,5.72];在与标签无关的定位顺序平衡下以及在实体名称唯一的 535 行上,增益仍然为正。对于跨三个模型的所有 2,434 个过滤的 EmbSpatial 配对关系问题,未更改的协议产生 +4.35 到 +11.79。匹配控制将局部重新聚焦与角色显式调节分开。这些结果将特定于查询的证据构建作为主要干预措施,并将相互一致性作为较小的特定于协议的细化。