论文

预测的皮层不是领域通用的先验:针对视频记忆性的大脑编码特征的匹配控制审核

Predicted Cortex Is Not a Domain-General Prior: A Matched-Control Audit of Brain-Encoding Features for Video Memorability

模型评测模型行为与机制分析

摘要

大脑编码基础模型能够很好地预测功能磁共振成像对视频、音频和文本的反应,足以赢得 Algonauts 2025 挑战。我们询问他们在没有扫描仪的情况下获得的预测反应是否是人类行为任务(预测短视频记忆力)的有用特征镜头。每个剪辑都被投影到 TRIBE v2 的预测皮质空间中,并根据匹配的对照(在大脑投影之前拍摄的模型自己的 V-JEPA2 视觉主干)通过脊回归进行评分。答案取决于数据集。在 Memento10k(499 个片段)中,骨干获胜(Spearman 0.594 vs 0.544);在 VideoMem(820 个剪辑)中,大脑投影获胜(0.415 vs 0.368)。因为声称顺序颠倒了,所以我们测试了颠倒本身:数据集与表示的交互为 +0.097,95% CI [+0.032, +0.160],两侧引导 p=0.001,超过 10 个交叉验证种子数据集完全分离(0/10 种子有利于 Memento10k 上的大脑投影,10/10 在 VideoMem 上有利于大脑投影)。跨数据集传输继承了分割:Memento10k->VideoMem 大脑投影获胜(+0.076);反向损失惨重(-0.311)。 VideoMem 的优势不是样本大小的伪影(它在匹配的训练大小和 PCA-then-ridge 中幸存下来),也不仅仅是压缩(压缩的、高度正则化或传输调整的主干保持在它之下)。因此,预测的大脑特征携带了一个小但真实的记忆信号,骨干网在一个数据集上错过了,而不是另一个:数据集特定的表示,而不是领域通用的先验。视觉正交分量(部分 Spearman 0.19,排列 p=2.5e-4)定位于腹侧枕颞皮层,并且预测的 BOLD 动态不会增加时间平均值之外的任何内容,因为每个剪辑 3-4 个样本无法解决亚秒级后期记忆响应。我们预先指定的数据集内假设返回 NO-GO;逆转才是幸存下来的。