论文

将多模态 大语言模型 知识集成到 Amodal Completion 中

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

应用与实践视觉感知与空间理解

摘要

随着自动驾驶汽车和机器人技术的广泛采用,重建图像中人和物体被遮挡部分的模态补全变得越来越重要。正如人类根据先前的经验和常识推断隐藏区域一样,这项任务本质上需要有关现实世界实体的物理知识。然而,现有的方法要么仅仅依赖于缺乏此类知识的视觉生成模型的图像生成能力,要么仅在分割阶段利用它,从而阻止其明确指导完成过程。为了解决这个问题,我们提出了 AmodalCG,这是一种新颖的框架,它利用多模态 大语言模型 (MLLM) 的现实知识来指导模态完成。我们的框架首先评估遮挡程度,仅当目标对象被严重遮挡时才选择性地调用 MLLM 指导。如果需要指导,该框架进一步纳入 MLLM 来推理缺失区域的 (1) 范围和 (2) 内容。最后,视觉生成模型集成了这些指导,并迭代地完善了可能因不准确的 MLLM 指导而产生的不完美完成结果。与所有现有工作相比,各种现实世界图像的实验结果显示出令人印象深刻的改进,这表明 MLLM 是解决具有挑战性的非模态完成问题的一个有前途的方向。