论文
ZeroR@CHiPSAL 2026:尼泊尔模因分类的两阶段视觉语言适应与对比学习
ZeroR@CHiPSAL 2026: Two-Stage Vision-Language Adaptation with Contrastive Learning for Nepali Meme Classification
摘要
本文介绍了我们的 CHiPSAL 2026 共享任务系统,该任务涉及尼泊尔模因中的多模式仇恨言论和情绪检测。我们解决这两个子任务:二元仇恨言论分类和三类情感分析。我们的方法使用 Qwen3-VL-8B-Instruct 来适应仇恨模因检测的鲁棒适应 (RA-HMD) 框架,Qwen3-VL-8B-Instruct 是一种具有原生梵文支持的最先进的视觉语言模型。我们采用两阶段训练流程:(1) LoRA 微调,带有用于生成分类的 MLP 投影头,(2) 对比骨干网 微调,带有监督 InfoNCE 损失。我们通过少数过采样、图像增强和焦点损失来处理类别不平衡。在推理时,我们使用经过验证调整的权重将第 1 阶段标记概率与第 2 阶段分类器分数进行整合。我们的端到端方法通过利用模型对梵文的原生理解,消除了来自单独 OCR 和翻译管道的错误传播。我们的系统在仇恨语音检测上获得了 \textbf{第二名} (F1: 0.797),在情感分析上获得了 \textbf{第四名} (F1: 0.518)。我们提供详细的消融、错误分析以及针对资源匮乏的南亚语言调整大型视觉语言模型的见解。