论文
RAG-Audio:用于忠实脑信号音频重建的检索增强生成
RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction
摘要
大脑到音频的重建受到\emph{先验支配}的限制:当预训练的生成器以微弱的神经信号为条件时,它会产生逼真但刺激不准确的音频。我们引入了 RAG-Audio,它将 fMRI 解码为语义音频嵌入,检索匹配的真实音频样本,并从该样本初始化冻结生成器的采样轨迹,同时保留解码的嵌入作为条件。在 Brain2Music 上,RAG-Audio 将 10 路刺激识别从直接生成的 $0.14$-$0.18$(接近 $0.10$ 机会水平)提高到 $0.40$-$0.43$,与检索相当。它还将 Fréchet Audio Distance 降低了大约一个数量级,AudioLDM 从 13.49 美元减少到 1.25 美元。 RAG-Audio 在识别方面接近最近邻检索,同时保持生成性;其较高的 FAD 是预期的,因为检索直接重放真实音频。缺乏可初始化潜在轨迹的自回归负控制没有显示出可比的增益,将改进归因于轨迹初始化。这些结果表明,检索引导的初始化可以减轻大脑到音频生成中的先前主导地位。