论文

SpatialQ:通过基于视觉的 MLLM 了解 3D 高斯泼溅场景质量

SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM

模型评测评测方法与指标

摘要

3D 高斯分布 (3DGS) 已成为新颖视图合成和 3D 场景重建的有效表示,对可靠的质量评估产生了日益增长的需求。与传统的图像质量评估 (IQA) 不同,3DGS 场景的质量不仅取决于渲染视图的感知保真度,还取决于场景级因素,例如空间结构和跨视图一致性。现有的 IQA 方法因其对 2D 感知线索的依赖而受到限制,而一般的多模态 大语言模型 (MLLM) 并非专为稳定的质量回归而设计,可能会产生不可靠的判断。为了解决这些限制,开发了用于 3DGS 场景理解的多模态质量评估框架。首先,通过使用专用质量头增强基于 VGGT 的编码器,引入了 3D 感知质量表示学习框架。多视图图像被编码为特定于视图的特征并聚合以捕获跨视图一致性,同时通过深度和点云相关结构信息的联合建模来合并几何线索,从而能够学习超越外观驱动特征的结构感知质量表示。其次,通过将原始图像、深度图、点云渲染和相机参数联合输入基于 Qwen 的 MLLM 来构建扎根的多模态推理机制。