论文
半导体 IC 封装 Vision Transformer 联合架构-词元-位宽多轴优化
Joint Architecture-Token-Bitwidth Multi-Axis Optimization of Vision Transformers for Semiconductor IC Packaging
摘要
Vision Transformer (ViTs) 已经实现了强大的视觉识别性能,但其在资源有限的工业环境中的部署仍然有限。主要挑战是高计算成本、内存要求和能耗。虽然神经架构搜索 (NAS)、词元压缩和低精度推理等单独的效率技术已得到广泛研究,但大多数先前的工作仅针对单个优化轴,在保持准确性的同时限制了总体部署增益。在本文中,我们提出了第一个整体框架,它联合优化了三个互补轴:架构、词元和位宽。具体来说,该框架通过神经架构搜索(AutoFormer)识别紧凑的主干,通过词元合并(ToMe)减少信息处理,并通过 fp16 混合精度推理加速每个操作的执行。在我们的研究中,我们分析了 ImageNet-1K 在积极压缩下的准确性与效率权衡。然后,我们将选定的配置应用于真实的内部 3D X 射线半导体缺陷分类数据集,以进行 IC 芯片封装检查。结果表明,所提出的多轴框架实现了超过 10 倍的吞吐量改进,同时参数计数、FLOP 和能耗减少了 10 倍以上,同时保持了下游工业任务所需的精度。据我们所知,这是联合优化 ViT 中的架构、词元和位宽维度的最早的工作之一,也是第一个针对半导体制造的资源高效、以部署为重点的研究。