论文

SMILE-Next:教学 大语言模型 检测、分类和推理笑声

SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter

摘要

笑声是一种复杂的社会信号,它传达了超越娱乐的交流意图。虽然之前的工作主要集中在孤立的笑声分析任务上,但对现实世界场景中笑声的全面理解仍未得到充分探索。因此,我们引入了 SMILE-Next,这是一个用于理解现实世界笑声的数据集,具有跨三个任务的多模态文本表示和问答注释:笑声检测、笑声类型分类和笑声推理。在 SMILE-Next 的基础上,我们的目标是开发一款专门用于笑声的 大语言模型,能够对现实世界中的笑声进行细致入微的理解。为此,我们提出了两个关键组件:笑声特定的自我指导和笑声专家混合(MoLE)框架。针对笑声的自我指导通过自动合成各种以笑声为中心的指令,增强了跨任务和领域的泛化能力。 MoLE 引入了任务自适应专家路由机制,可以动态选择针对每个与笑声相关的任务量身定制的专业专家,从而提高特定任务的性能和效率。实验结果表明,我们提出的组件组合大大优于多模态 LLM 基线,从而促进了对现实世界笑声的强大理解。项目页面位于:https://mok0102.github.io/smile-next/。