论文

用于全景街道分割的 Vision Transformer Ensembles

Vision Transformer Ensembles for Panoramic Street Segmentation

应用与实践视觉感知与空间理解

摘要

街道全景图的语义分割可以支持城市环境的详细描述,但小数据集和不平等的训练成本使得模型选择变得困难。本文介绍了在 2026 年 10 月 5 日的排行榜快照中用于向 PalmCity 挑战赛提交第一名的系统。使用大致相等的计算预算对九个预训练分割系统进行了比较。候选者包括 DeepLabV3+、SegFormer、UPerNet、Mask2Former、带有线性解码器的 DINOv3,以及使用 DINOv3 的仅编码器 Mask Transformer。两位领先的候选人使用三个随机种子和更长的预算进行独立训练。对三个仅编码器 Mask Transformer 模型的类概率进行相等平均,在具有水平反射的三个图像尺度上进行评估,在 84 个图像公共验证分割上产生 60.95% 的并集平均交集和 71.16% 的平均 F1。提交的预测在隐藏测试排行榜上获得了 57.08% 的平均交叉率和 67.96% 的平均 F1 率。生成所有 249 个测试模板需要 251.49 秒,包括在一台 NVIDIA RTX 5090 上进行模型初始化和来源检查。分配的 GPU 记忆峰值为 2.70 GiB。该研究报告所有符合条件的模型、所有推理变体、类级别错误、源条件和再现性检查,提供现有架构的记录挑战工作流程。

用于全景街道分割的 Vision Transformer Ensembles的原论文方法或结果图
图 3:所有 84 张图像中最接近像素一致性下四分位数、中值和上四分位数的真实验证示例。此选择使用像素一致性而不是类平衡 IoU。预测是所选三个种子集合的保存输出,具有比例和反射。面具使用 PalmCity 官方颜色。粉色标记了不正确的类标识符,包括 Void。