论文

RD-ViT:循环深度视觉 Transformer 用于语义分割,减少数据依赖性将循环深度 Transformer 架构扩展到密集预测

RD-ViT: Recurrent-Depth Vision Transformer for Semantic Segmentation with Reduced Data Dependence Extending the Recurrent-Depth Transformer Architecture to Dense Prediction

模型架构递归架构

摘要

Vision Transformer (ViTs) 实现了最先进的分割精度,但需要大量训练数据集,因为每一层都有必须独立学习的独特参数。我们推出了 RD-ViT,这是一种循环深度视觉 Transformer,它采用循环深度 Transformer (RDT) 架构来适应密集预测任务,支持 2D 和 3D 输入。 RD-ViT 将独特的 Transformer 块的深度堆栈替换为循环 T 次的单个共享块,并通过 LTI 稳定状态注入进行增强以保证收敛、用于空间计算分配的自适应计算时间 (ACT)、深度方向的 LoRA 自适应以及用于特定类别专业化的可选专家混合 (MoE) 前馈网络。我们在 2D 切片级和 3D 体积设置中评估 ACDC 心脏 MRI 分割基准,并在 Google Colab 中执行完全真实的实验。在 2D 中,RD-ViT 在 10% 训练数据(Dice 0.774 vs 0.762)和完整数据(0.882 vs 0.872)下优于标准 ViT。在 3D 中,带有 MoE 的 RD-ViT 在 3.0M 参数下达到了 Dice 0.812,在参数数为 53% 时达到了标准 ViT 性能 (0.817) 的 99.4%。 MoE 专家利用分析表明,不同的专家自发地专门研究不同的心脏结构(RV、MYO、LV),而无需明确的路由监督。 ACT 停止图显示心脏边界处的计算分配更高,训练期间平均思考时间从 2.6 次迭代减少到 1.4 次迭代,证明了学习的计算效率。深度外推可以通过比训练更多的循环进行推理而不会退化。所有代码、笔记本和结果均公开发布。