论文
VLM 可以进行稳健推理吗?神经符号研究
Can VLMs Reason Robustly? A Neuro-Symbolic Investigation
摘要
视觉语言模型(VLM)已应用于广泛的推理任务,但仍不清楚它们是否可以在分布变化下进行稳健的推理。在本文中,我们研究了协变量变化,其中感知输入分布发生变化,而基础预测规则却没有变化。为了研究这个问题,我们考虑视觉演绎推理任务,其中需要模型来回答给定图像和针对图像中的对象概念定义的逻辑规则的查询。根据经验,我们发现通过基于梯度的端到端训练进行微调的 VLM 可以实现较高的分布精度,但在这种变化下无法泛化,这表明 微调 不能可靠地诱导底层推理功能。这激发了一种将感知与推理脱钩的神经符号观点。然而,我们进一步观察到,最近依赖黑盒组件进行推理的神经符号方法仍然可能在不同任务中表现出不一致的鲁棒性。为了解决这个问题,我们提出了 VLC,一种将基于 VLM 的概念识别与基于电路的符号推理相结合的神经符号方法。特别是,任务规则被编译成符号程序,特别是电路,该电路精确地在VLM识别的对象概念上执行规则。对具有不同规则集的三个简单视觉演绎推理任务的实验表明,与其他推理范例相比,VLC 在分布外数据上始终能实现更高的任务准确性。代码可在 https://github.com/uiuctml/VLC 获取。