论文
OmniAct3D:基础几何+证据接地推理的全景3D检测
OmniAct3D: Leveraging Foundation Geometry and Evidence-Grounded Reasoning for Panoramic 3D Detection
摘要
精确的3D检测对移动具身智能体至关重要,视觉基础模型(VFM)提供可迁移的视觉与几何先验。但既有基于VFM的3D检测器依赖窄视单目图像或离散透视图,限制了连贯的环视感知;等距柱状投影(ERP)则把连续360度场景编码进单张图像。直接迁移仍困难:ERP以不同方式组织几何与视觉信息,使物体相关线索难以建模、定位与保留。我们提出OmniAct3D,把透视图训练的VFM检测器适配到ERP同时保留可迁移VFM先验:为解决几何错配,ERP射线几何适配器(ERGA-Ray)建模球形视线与周期空间结构;为在全景语境中定位证据,视觉-动作推理链(VARC)把每个假设接于相关全景证据并转换为结构化几何动作;为恢复固定token预算下丢失的局部线索,外观引导朝向专家(AGHE)以更高分辨率重编码物体区域做朝向估计。实验显示OmniAct3D在Spheriverse较此前最佳3D检测器提升2.96 NDS,在PanoMMOcc较未适配VFM基线提升24.87 mAP;使用目标特定几何适配时VARC保留同配置mAP的95-98%,表明物体级3D推理可跨感知配置复用。代码/项目页:https://github.com/FeiT-FeiTeng/OmniAct3D。