论文

FTibSuite:藏语视觉语言建模综合资源套件

FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

模型评测基准与评测资源

摘要

视觉语言模型进展迅速,但由于缺乏可重复的训练和评估基础设施,藏语仍然是一种资源严重不足的语言。为了填补这一空白,我们引入了 FTibSuite,这是一个用于藏语视觉语言研究的综合资源套件,由 FTibData(经过人类验证的多模态训练语料库,涵盖持续预训练、图像文本对齐和指令调整数据)、FTibBench(五个主流多模态基准的藏语改编,具有分层质量控制工作流程以减少翻译噪声)和 FTibVLM(一个基于Qwen3-VL-8B-通过三级适应管道进行指令。 FTibBench 上的实验表明,FTibVLM 在所有任务中都能提供一致的性能提升,例如将 MMBench 精度从 42.97 提高到 67.78,将 POPE 随机精度从 47.53 提高到 80.56,同时保留骨干网的原始中文能力,且降级最小,为西藏多模态研究提供了第一个标准化基础。