论文
Physical AI智慧空间多机位3D感知基准
Physical AI Smart Spaces: A Large-Scale Benchmark for Multi-Camera 3D Perception in Smart Spaces
摘要
Physical AI Smart Spaces据我们所知是首个同时为室内智慧空间提供大规模、多类、多机位3D感知数据的基准:包含在仓库、医院、零售等场景由近1800个摄像头采集的280多小时同步1080p视频,附多机位身份、2D框、3D框、相机标定及可用深度的自动标注。基准横跨Isaac Sim合成生成、Cosmos Transfer外观增强与真实Sim2Real评估;真实目标包含两个仓库部署的时间同步流、基于VGGT的自动标定,以及把世界系3D框投影到各视角供跨相机核验的3D标注界面。我们描述数据集范围、标注与标定模式、生成工作流、基准协议与标准化提交格式和排行榜的官方评估系统。核心贡献是高阶跟踪精度(HOTA)的3D实例化,把通常基于2D框的跟踪评估扩展到3D位置与3D框;并报告来自AI City Challenge排行榜的经验基线,展示方法如何在现实智慧空间约束下从纯行人3D定位跟踪演进到多类3D框跟踪。发布于huggingface.co/datasets/nvidia/PhysicalAI-SmartSpaces。代码/项目页:https://huggingface.co/datasets/nvidia/PhysicalAI-SmartSpaces。