论文
我们真的需要大于1B参数的多模态情绪语言模型吗
Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?
摘要
多模态大语言模型(MLLM)的近期进展显著改善多模态情绪识别(MER)表现,并通过联合建模视频、音频与语言等启用可解释的描述生成。但这些性能提升常伴随模型参数规模增长(如至少7B),同时带来高计算成本并降低推理效率——阻碍在机器人与移动设备等资源受限平台上的实时部署。这引出根本问题:高质量MER真的需要大于1B参数的多模态模型吗?本文挑战“更大模型天然必要”的假设,提出轻量MER框架Light-MER:经知识蒸馏实现更好更快的多模态情感理解与识别。它把知识从强的大规模教师模型转移到轻量的十亿参数以下学生模型,在保留丰富多模态情绪推理与识别的同时大幅提升部署效率。具体引入两种新优化策略增强知识转移:(1) 结合切片沃瑟斯坦距离与隐状态对齐的新最优传输损失;(2) 基于GRPO、平衡MER表现与效率的新多重奖励优化策略。九个基准数据集上的大量实验证明Light-MER在显著提升推理效率的同时取得最先进表现。凸显小型多模态情绪语言模型对未来研究的强潜力。代码见https://github.com/GAIR-Lab/Light-MER。
