论文

基于Dirichlet参数化的不确定性感知多模态情感识别

Uncertainty-Aware Multimodal Emotion Recognition through Dirichlet Parameterization

模型推理推理验证与自校正

摘要

本工作提出一个面向边缘设备部署的轻量级、隐私保护的多模态情感识别(MER)框架。为展示该框架的通用性,我们的实现使用了语音、文本和人脸图像三种模态。不过,该系统是完全模块化的,可扩展以支持其他模态或任务。每种模态都通过一个为推理效率优化的专用骨干网络处理:语音采用Emotion2Vec,面部表情采用基于ResNet的模型,文本采用DistilRoBERTa。为调和各模态间的不确定性,我们引入了一种基于Dempster-Shafer理论与Dirichlet证据、与模型和任务无关的融合机制。该方法直接作用于模型logits,无需额外训练或联合分布估计即可捕获预测不确定性,因而可广泛应用于情感识别之外的领域。在五个基准数据集(eNTERFACE05、MEAD、MELD、RAVDESS与CREMA-D)上的验证表明,我们的方法在保持计算高效以及对模糊或缺失输入鲁棒的同时,取得了有竞争力的准确率。总体而言,所提出的框架强调模块化、可扩展性与现实可行性,为面向医疗保健、人机交互及其他情感相关应用的不确定性感知多模态系统铺平了道路。

基于Dirichlet参数化的不确定性感知多模态情感识别
(a) 我们的流程