论文
高效统一多模态理解 (EUMU):第八届 LSVOS 挑战赛 MUMU 赛道的获胜解决方案
Efficient Unified Multimodal Understanding (EUMU): Winning Solution for the MUMU Track at the 8th LSVOS Challenge
摘要
移动统一多模态理解 (MUMU) 挑战赛需要一个有效的模型来联合执行多概念图像标记、开放词汇对象检测和图像字幕。我们推出高效统一多模态理解 (EUMU),这是第八届 LSVOS 挑战赛 MUMU 赛道的获胜解决方案。 EUMU 建立在共享的预训练多模态模型的基础上,使用其基于提示的功能进行检测和字幕,并在共享视觉特征上训练轻量级头部来预测质量、场景和事件标签。 EUMU 不是独立处理这三个任务,而是通过重用任务输出作为跨任务线索来应用任务感知推理细化。对于检测,字幕提示有助于恢复初始检测中遗漏的对象。对于字幕,检测提示有助于细化字幕以更好地反映检测到的对象。对于标记,图像统计数据可完善质量预测,而字幕和检测线索可完善场景和事件预测。此设计将所有三个任务统一在一个模型中,同时满足挑战的资源限制。 EUMU包含239.169M参数,需要23.947 GFLOPs,使用4.5 GB峰值推理内存,最终挑战得分为17.3409。代码和模型可在 https://github.com/Dayoung-Kil/EUMU 获取。