论文

MindAlign:在有限数据下通过多模态嵌入对齐从 fMRI 信号中解码内部语音

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

模型训练参数高效训练

摘要

由于缺乏明显的语言输出、有限的训练数据和较大的受试者间变异性,从非侵入性大脑信号中解码内部语音仍然是一个基本挑战。现有的大脑到文本的方法通常依赖于特定于任务的解码器 微调,这限制了可扩展性并使对新参与者的适应变得复杂。我们提出了 MindAlign,这是一种解耦的两阶段大脑到语言框架,可以从 fMRI 信号生成开放式文本,而无需修改底层语言模型。第一阶段学习特定于主题的神经语义对齐,将功能磁共振成像活动映射到共享的多模态语义空间,提取内部生成句子的潜在语义草图。第二阶段将这个草图与视觉上下文相结合,以促进冻结的多模态语言模型的自由形式生成。对无声图像描述期间收集的 fMRI 数据进行的实验表明,所提出的方法始终优于仅 fMRI 和随机基线。我们进一步表明,学习到的语义到语言的投影可以跨主题推广,与特定主题的神经对齐配对时可以实现有效的解码。这些结果表明,神经信号调节语义内容超出了图像驱动的先验,支持大脑到文本解码的可扩展和模块化方向。