论文
用于全景街道分割的 Vision Transformer Ensembles
Vision Transformer Ensembles for Panoramic Street Segmentation
摘要
街道全景图的语义分割可以支持城市环境的详细描述,但小数据集和不平等的训练成本使得模型选择变得困难。本文介绍了在 2026 年 10 月 5 日的排行榜快照中用于向 PalmCity 挑战赛提交第一名的系统。使用大致相等的计算预算对九个预训练分割系统进行了比较。候选者包括 DeepLabV3+、SegFormer、UPerNet、Mask2Former、带有线性解码器的 DINOv3,以及使用 DINOv3 的仅编码器 Mask Transformer。两位领先的候选人使用三个随机种子和更长的预算进行独立训练。对三个仅编码器 Mask Transformer 模型的类概率进行相等平均,在具有水平反射的三个图像尺度上进行评估,在 84 个图像公共验证分割上产生 60.95% 的并集平均交集和 71.16% 的平均 F1。提交的预测在隐藏测试排行榜上获得了 57.08% 的平均交叉率和 67.96% 的平均 F1 率。生成所有 249 个测试模板需要 251.49 秒,包括在一台 NVIDIA RTX 5090 上进行模型初始化和来源检查。分配的 GPU 记忆峰值为 2.70 GiB。该研究报告所有符合条件的模型、所有推理变体、类级别错误、源条件和再现性检查,提供现有架构的记录挑战工作流程。
