论文
将语音语言模型中的决策规则错位与读出覆盖限制分开
Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models
摘要
语音语言模型越来越多地通过提示答案的准确性来评估副语言任务,但答案准确性结合了音频到答案计算的不同阶段的失败。我们引入了一个一代对齐的诊断阶梯,它比较发出的答案、选项 logits、这些 logits 的仿射读出以及同一答案标记处隐藏状态的线性读出。连续的差异将终点、决策规则和读数覆盖差距分开。在五个系统和两个情感语料库中,状态解码平均比生成准确度高 27.8 个点,并且决策规则和读出覆盖差距在所有 10 种情况下都是正的。无标签 logits 校正提高了每种条件下生成的准确性,表明决策规则差距的一部分是可操作的。在排名匹配的比较中,本机读出之外的情感信息泛化到伸出的说话者,并且在测量的声学描述符的控制下幸存下来,但替换选定的读出外部方向通常对发出的答案影响不大。这些结果将信息可用性与行为使用区分开来,并在决策规则和状态到答案读出中定位性能损失。