论文

VIRO:面向指代表达理解的带验证鲁棒高效神经符号推理

VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension

模型推理推理验证与自校正

摘要

参考表达理解(REC)旨在定位与自然语言查询相对应的图像区域。最近的神经符号 REC 方法利用大语言模型 (LLM) 和视觉语言模型 (VLM) 来执行组合推理,将查询分解为 4 个结构化程序并逐步执行。虽然此类方法实现了可解释的推理和强大的零样本泛化,但它们假设中间推理步骤是准确的。然而,这种假设会导致级联错误:错误检测和无效关系通过推理链传播,即使图像中不存在目标,也会产生高置信度的误报。为了解决这一限制,我们引入了验证集成推理算子(VIRO),这是一种神经符号框架,可在推理步骤中嵌入轻量级算子级验证器。每个算子执行并验证其输出,例如对象存在或空间关系,从而使系统能够在不满足验证条件时稳健地处理无目标情况。我们的框架实现了最先进的性能,在有目标和无目标设置中达到 61.1% 的平衡准确度,并展示了对现实世界自我中心数据的泛化。此外,VIRO 在吞吐量、程序故障率低于 0.3% 的高可靠性以及通过解耦程序生成与执行的可扩展性方面表现出卓越的计算效率。

VIRO:面向指代表达理解的带验证鲁棒高效神经符号推理
图1:缺失验证会导致被迫给出的预测,而 VIRO 可防止这种情况。以往 REC 方法与我们的 VIRO 框架在无目标情形下的示意性对比。以往 REC 方法(左)由于缺乏剔除错误候选的机制,即使查询无法在图像中定位到依据,也被迫输出一个预测。相比之下,我们的 VIRO 框架(右)会提前终止而不是幻觉出一个预测:(i) FIND 算子识别出图像中没有大象(上);(ii) FIND_DIRECTION 算子识别出该人并不位于大象左侧(下)。