论文
Mind-Omni:基于离散扩散的脑-视觉-语言建模统一多任务框架
Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion
摘要
建模外部刺激与内部神经表征之间的相互作用是脑机接口(BCI)的一个关键研究领域。先前工作的主要局限在于专用单任务模型的普遍范式,这削弱了通用性并忽视了任务间协同。为此,我们提出Mind-Omni,首个通过离散扩散范式统一七种不同编码与解码任务的通用框架。其核心是新颖的Brain Tokenizer,将异构的连续脑信号转换为标准化的离散token。这使得任意两个或更多模态能在共享语义空间内进行直接的token级交互,实现相互理解与生成。为解锁高级推理能力,我们进一步构建了专门的脑部问答(BQA)指令微调数据集。我们的模型不仅在多任务统一框架中确立了新的最优水平,还为多任务协同提供了有力证据。通过展示与更大规模专用模型相当乃至时而更优的性能,我们的工作为神经建模提供了强大的新范式,并为神经活动基础模型铺平道路。代码已在https://github.com/ReedOnePeck/Mind-Omni公开。
