论文

神经语音解码中的上下文先验可能反转置信排序

Confidence-Ordering Reversal under Contextual Priors in Neural Decoding

模型评测鲁棒性、公平性与可信度评测

摘要

上下文先验通过重塑候选分数来改进神经语言解码。然而,置信度是从相同的重塑分数中读取的,因此先验留下的错误可以变得更加置信,而不会改变揭示它的准确性。我们研究先验如何使用本地解码分数、加性浅层融合结合的上下文先验以及融合后最高两项的分数差作为置信度,在 MEG-MASC 和 MOUS 上塑造语音检索的置信度。在最初的错误预测中,我们发现置信度顺序逆转:当正确的候选者开始接近本地排名的顶部时,较大的余量使得修复的可能性更大,但当它开始较低时,修复的可能性较小。在 MEG-MASC 上,汇总正确性 AUROC 为 0.87,但将修复与残余错误分开的 AUROC 从初始排名2—3 的 0.70 下降到排名 21-50 的 0.39。初始排名在20名之后、位于反转区域内的错误占所有融合后错误的 46.6%。我们提出了一个分数层面的解释:修复必须首先弥补正确候选者的初始赤字,限制其最终的差距,而残余错误可以在两个不正确的候选者之间建立很大的差距。仅改变融合权重的因果干预将逆转推向更较低排名,正如预测的那样。在词级 LM 先验下,它在准确率增益达到峰值后继续移动,因此为准确率选择的权重并不能解决置信度问题。分别读取本地分数和先验分数可以提高选择性解码:解码器在 74.5% 的窗口上进行回答,而不是 56.7%,而 92% 的输出集仍然包含正确的候选者。上下文融合后的置信度应该保留每个预测背后的本地和上下文证据,而不仅仅是融合的分数。项目网址:https://confidencereversal.github.io/; 代码:https://github.com/AmadeusFake/NeuDecodingConfReversal

神经语音解码中的上下文先验可能反转置信排序:论文原图
图 1:上下文融合可以使错误更有把握。本地编码器对来自当前 MEG 窗口的候选者进行评分,而来自先前窗口的上下文先验通过与权重 $\alpha=2$ 的加性融合来调整这些分数。先验的操作粒度较粗,因此多个候选者共享一个分数。 Fusion 将正确的候选者 ($\star$) 从排名 40 提升到排名 7,而不校正预测,同时将前两名的余量从 0.3 增加到 0.8。括号标记先前的边缘和融合的边缘。数值是说明性的;真实案例见表6。