论文
消除时间快捷方式可改善非侵入式大脑到文本的传输
Removing Timing Shortcuts Improves Non-Invasive Brain-to-Text
摘要
我们发现,在非侵入性大脑记录中解码单词方面所报告的重大改进在很大程度上可以在没有任何大脑数据的情况下重现。在 d'Ascoli 等人的有影响力的作品中。 (2025),感知连续语音的受试者的大脑活动的时间序列被分割成从每个单词开始的固定长度的窗口。然后,神经网络一起生成对句子中所有单词的预测。相邻窗口部分重叠,隐含地揭示了单词之间的间隔。由于这些间隔表示所说单词的持续时间,并且不同的单词往往具有不同的持续时间 - 例如,“the”比“supercalifragilisticexpialidocious”短得多 - 神经网络可以改进其对单词的预测,而不依赖于底层的大脑活动。与此相一致的是,该方法在不包含大脑信息的合成信号上达到了 22.0% 的平衡准确度,而在真实大脑记录上的平衡准确度为 22.3%。为了防止网络学习这个快捷方式,我们做了一个简单的更改。我们不是对句子中的所有窗口进行联合编码,而是独立地处理每个窗口。因此,神经网络通过从大脑记录中学习潜在的特定单词信息来实现更好的性能。这使得现有的两种策略变得比以前有效得多。聚合对同一单词的不同神经反应的预测以及使用预训练的 LLM 作为语言先验现在都可以显着改善结果。在我们的感知语音基准测试中,这个简单的方法 (SimpleB2T) 在每个单词 5 次观察的情况下实现了 36.6% 的单词错误率,接近过去的侵入式语音解码性能,尽管是在不同的条件下。这项工作的结果揭示了大脑到文本解码的一个重要捷径,并表明删除它会带来一种简单且更有效的策略。