论文

视觉模型检验:面向图像检索的基于图的视觉例程推断

Visual Model Checking: Graph-Based Inference of Visual Routines for Image Retrieval

摘要

信息检索是现代数字产业的基础。尽管近年来自然语言搜索在基于嵌入的模型与大规模预训练的推动下取得巨大进展,该领域仍面临重大挑战。具体而言,涉及复杂关系、对象组合或身份、数量与比例等精确约束的查询,在现有框架中常悬而未决或不可靠。本文提出一个新框架,通过基于图的验证方法与神经代码生成的协同组合,将形式化验证融入基于深度学习的图像检索。我们的方法旨在支持开放词表自然语言查询,同时产出可信且可验证的结果。通过把检索结果锚定于形式化推理系统,我们超越了向量表示常见的模糊与近似。我们的框架不接受不确定性为既定事实,而是对照检索内容显式验证用户查询中的每个原子真值。这使我们不仅能返回匹配结果,还能识别并标记哪些具体约束被满足、哪些未被满足,从而提供更透明、更可问责的检索过程,同时提升最流行的基于嵌入方法的结果。

视觉模型检验:面向图像检索的基于图的视觉例程推断
图1:所提出的视觉搜索框架的视觉摘要。系统遵循模型检验(model checking)方法:文本查询首先被转换为结构化的系统规约(图)。为每个局部规约生成相应的视觉例程(代码)。随后依据候选图像对这些视觉例程的满足程度进行排序(剪枝/prunning),从而支持在数字环境中对视觉内容进行部分或完整验证。