论文
通过机器想象整合视觉知识以增强零样本常识推理
Enhancing Zero-shot Commonsense Reasoning by Integrating Visual Knowledge via Machine Imagination
摘要
零样本常识推理的最新进展使预训练语言模型(PLM)无需任务特定微调即可获得广泛的常识知识。尽管取得这些进展,这些模型经常受到文本知识中人类报告偏差的限制,导致机器与人类之间的理解差异。为弥合这一差距,我们引入一种额外模态来丰富PLM的推理能力。我们提出Imagine(Machine Imagination-based Reasoning),一个新颖的零样本常识推理框架,用机器生成图像提供的视觉信号补充文本输入。具体而言,我们通过将图像生成器直接嵌入推理流水线,赋予PLM想象能力。为促进对这种想象视觉上下文的有效利用,我们构建了模拟视觉问答场景的合成数据集。通过在多个常识推理基准上的全面评估,我们证明Imagine显著优于现有零样本方法,甚至超过先进的大型语言模型。这些结果凸显了机器想象缓解报告偏差并显著增强常识推理模型泛化能力的能力。
