论文
具有稀疏自选择功能的脑对齐多流视频 Transformer
Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection
摘要
现代视频 Transformer 通常忽略灵长类动物视觉的原理,并且很少根据神经数据进行评估,从而限制了其生物学可解释性。我们引入了一种稀疏的赢者通吃的词元选择模块,它取代了密集的自注意力,以提高效率并近似生物视觉电路中观察到的竞争路由。我们进一步提出了一种受神经启发的分割和融合视频 Transformer,它使用两个互补的路径:一个高分辨率、低帧速率的“什么”流和一个低分辨率、高帧速率的“哪里”流,在分类之前融合。在 Kinetics-400 和 Something-Something V2 上,我们的最佳变体在具有可比规模和预训练的模型之间的准确性与推理时间的帕累托前沿上运行,并显示出对空间扰动的改进的鲁棒性。使用相同视频刺激的模型嵌入和时间分辨脑电图记录之间的表征相似性分析,我们的模型获得了 0.18 的峰值大脑模型相关性(约噪声上限的 78%),并且始终优于强视频 Transformer 基线,这表明路径专业化和稀疏竞争对于高效、大脑对齐的视频理解是有用的归纳偏差。