论文

SEA-CLIP-Tiny:面向东南亚语言的紧凑图文蒸馏

SEA-CLIP-Tiny: Efficient Multilingual Text-Vision Embedding for Southeast Asian Languages

摘要

多语言文本视觉嵌入模型对于跨语言图像文本检索至关重要,但由于该地区的语言多样性以及有限的数据和计算资源,东南亚语言的支持仍然很差。在本文中,我们介绍了 SEA-CLIP-Tiny,这是一种适用于东南亚的紧凑型多语言文本视觉嵌入模型,参数少于 50M。我们的模型通过区域数据管理和多语言教师指导,将 CLIP-KD 式框架适应东南亚多语言环境。跨七种东南亚语言的实验表明,SEA-CLIP-Tiny 在评估的学生模型中实现了最强的平均检索性能,在 R@1、R@5 和 R@10 时分别达到 12.9%、31.5% 和 42.2%。与 MobileCLIP2 相比,它的平均 R@10 提高了 12.1 个点,同时使用的参数减少了 38.4%,测得的 CPU 延迟也更低。这些结果凸显了区域感知训练对于东南亚高效多语言文本视觉模型的重要性。 资源链接:https://huggingface.co/collections/fassabilf/sea-clip-tiny-accv-2026;https://github.com/fassabilf/sea-clip-tiny。

SEA-CLIP-Tiny的数据筛选与多教师蒸馏训练框架。
图3(图注摘要):SEA-CLIP-Tiny的数据筛选与多教师蒸馏训练框架。