论文
超越特征融合:用于多模态不确定性估计的上下文贝叶斯 PEFT
Beyond Feature Fusion: Contextual Bayesian PEFT for Multimodal Uncertainty Estimation
摘要
我们引入了 CoCo-LoRA,这是一种多模态、不确定性感知参数高效的 微调 方法,用于伴随音频上下文的文本预测任务。现有的 PEFT 方法(例如 LoRA)是高效的,但通常是确定性的,而最近的贝叶斯低秩适配器以轻量级的方式对不确定性进行建模,但在很大程度上仍然是单峰的,并且条件不确定性主要取决于内部文本特征。这使得它们无法反映由背景噪声、通道变化或说话风格等外部声学因素驱动的不确定性,这些因素可能会严重影响以语音为中心的应用的可靠性。 CoCo-LoRA 通过在本地文本衍生的适配器特征和音频衍生的上下文信号上调节低秩空间中的上下文变分后验来解决这一差距。池化音频嵌入一次投影到共享上下文空间中,然后通过轻量级逐层头进行调整,从而实现适配器不确定性的全局到局部、深度特定的调制并进行更新,而无需高维多模态融合。随机性仅限于秩空间中的紧凑潜在组件,保留 PEFT 可扩展性,同时产生音频敏感的异方差不确定性。根据我们对不同任务和主干组合的评估,CoCo-LoRA 始终匹配或优于纯文本 PEFT 和传统的特征融合传输基线,特别是在可靠适应至关重要的高覆盖率标签上。结果表明,使用音频作为上下文不确定性信号,而不是作为融合特征流,为多模态低资源预测提供了稳健且参数高效的替代方案。