论文

VISA:VLM 引导的 3D 占用世界模型实例语义审计

VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models

摘要

语义 3D 占用为自动驾驶和机器人决策提供了体素化的世界状态,但对象和稀有类错误可能会影响自由空间解释、碰撞检查和时间状态传播。我们展示了一种常见的 VLM 策略,将 3D 体素或对象特征与裁剪图像描述嵌入对齐,可以提高文本空间相似性,但不会可靠地提高闭集占用率 mIoU。受这种不匹配的推动,我们提出了 VISA,一种针对现有占用世界模型的训练时语义审计方法。 VISA 在每个物理对象实例的代表性作物上查询离线 VLM,获得包含类假设、似是而非的混淆、可靠性、属性和证据的结构化审核,并将其沿对象轨道传播。审计以匹配的 3D 对象体素为基础,并通过可靠性加权分类法、属性因子和场景级审计图损失提炼为语义 logits,而推理保持不变且不需要 VLM。在 NuScenes 上,对三轮运行进行平均,VISA 将 OccWorld 从 19.06 mIoU 提高到 20.05 mIoU,将 GaussianWorld 从 21.36 mIoU 提高到 21.91 mIoU;在 GaussianWorld 上,对象 MIoU 从 18.18 提高到 19.16,稀有类 MIoU 从 15.60 提高到 16.79。这些结果表明,VLM 更适合作为具有可靠性意识的语义审核员而不是作为通用标题嵌入目标来封闭集占用。