论文
Jev 匹配 7B 语言模型进行言语神经假体重新评分
Jev Matches 7B Language Models for Speech-Neuroprosthesis Rescoring
摘要
语音神经假体从大脑活动中解码尝试的语音,并通过使用数十亿参数的语言模型(唯一需要 GPU 的组件)重新评分解码器的候选句子来结束。用更便宜的模型替换该模型是很困难的:通用语言模型要求从列表中标签所在位置的答案中选择一个句子,而不是从句子本身。我们将重新评分视为单一类型的决策,一次调用返回每个候选者的概率,由 Jev(一种经过校准决策训练的托管模型)提供服务,并将其与解码器自己的分数相结合。在来自 ALS 参与者的 978 个保留句子中,仅发布的解码器就达到了 8.1% 的单词错误,Jev 达到了 7.5%,而 OPT-6.7b 和 Qwen2.5-7B 则为 7.8%;解码器权重重新调整后,为 6.9%,对比 7.2% 和 7.4%。 Jev 在所有四项比较中都领先,并且在 95% 界限上最多落后 0.2 个百分点。每千句成本为 0.07 美元,无需 GPU;运行 7B 模型的专用 GPU 每句话的利用率仅高于 43%,远远超出一个用户生成的成本。互联网上的端到端延迟为 262 毫秒,其中 62 毫秒花费在提供商处,与本地 GPU 上的 7B 模型 (27 毫秒) 的顺序相同,但并不更快。