论文
BAT-CLIP:对齐脑、音频和文本的三模态表示
BAT-CLIP: Trimodal Alignment of Brain, Audio and Text
摘要
解码和解释来自大脑的自然语音越来越依赖于与预先训练的语音和语言表示空间的对齐。然而,尽管大脑本质上具有多模态语音处理能力,但当前的 CLIP 式大脑语音对齐将神经活动置于单一锚定模态(音频或文本)上。这导致了一种权衡:音频锚定保留了时间结构,但削弱了语言的可分离性,而文本锚定捕获了语义,但丢弃了声学细节。我们提出了 BAT-CLIP,这是第一个用于 iEEG 的 CLIP 式三模态对齐框架,它将神经嵌入联合对齐到共享的、冻结的音频文本流形中的预训练音频和文本锚点。在自然播客基准上,BAT-CLIP 比双模态 CLIP 基线产生更稳健的表示。我们还强调了使用自监督基础模型进行 CLIP 训练的重要性。
