论文
HyPASE:用于参数高效语音情感的双曲几何 微调 大型音频语言模型框架
HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models
摘要
大型音频语言模型 (LALM) 擅长一般语音理解;然而,使它们适应语音情感识别(SER)等细粒度任务仍然是一个重大瓶颈。当前的参数高效 微调 (PEFT) 方法通常在平坦的欧几里得空间中运行,这种几何学无法捕获情感线索的多粒度性质,其范围从底层韵律到高层语义。为了解决这个问题,我们提出了 HyPASE,一种基于 LALM 的 SER 的双曲 PEFT 框架。 HyPASE 利用庞加莱球模型,使用双曲半径作为表示粒度的显式代理。该框架由两个核心组件组成:用于层自适应权重调制的双曲几何适配器(HGA),以及将多尺度特征压缩为紧凑音频前缀的情感感知多容量跨模态聚合器(EMCA)。标准基准的实证结果表明,HyPASE 在 MELD 的所有指标上均优于欧几里得 PEFT 基线,并在 IEMOCAP 上实现了显着的未加权准确度增益,特别是在类别不平衡的情感识别中,同时伴随着轻微的加权准确度权衡,反映了双曲空间的少数类别表示的几何优先级;此外,HyPASE 在有限的参数预算内实现了稳健的零样本跨数据集泛化。通过以双曲几何为基础的适应过程,HyPASE 为 LALM 微调 提供了一条高效的路径。