论文

Lookalike3D:在 3D 中看到双重

Lookalike3D: Seeing Double in 3D

应用与实践视觉感知与空间理解

摘要

3D 对象理解和生成方法产生了令人印象深刻的结果,但它们经常忽略现实世界场景中普遍存在的信息源:重复的对象。我们介绍了室内场景中相似物体检测的任务,该任务利用来自相同和接近相同的物体对的重复和互补的线索。给定输入场景,任务是使用多视图图像作为输入将对象对分类为相同、相似或不同。为了解决这个问题,我们提出了 Lookalike3D,这是一种多视图图像 Transformer,它通过利用大型图像基础模型的强语义先验来有效地区分此类对象对。为了支持这项任务,我们收集了 3DTwins 数据集,其中包含基于 ScanNet++ 手动注释的 76k 个相同、相似和不同的对象对,并且显示 IoU 比基线提高了 104%。我们展示了我们的方法如何改进下游任务,例如实现联合 3D 对象重建和部分共同分割,将重复和相似的对象转变为一致、高质量 3D 感知的强大线索。我们的代码、数据集和模型将公开。