论文
SpeechLM 会听取他们自己的意见吗?诊断和减轻流媒体情感理解中的先前信念污染
Do SpeechLMs Hear Their Own Opinions? Diagnosing and Mitigating Previous-Belief Contamination in Streaming Emotion Understanding
摘要
流式情感理解使用历史状态,同时持续解释当前音频,通常将模型之前的预测反馈为上下文。我们证明,这种历史条件作用可能会扭曲当前的看法。在平衡的 CREMA-D-Stream 反事实诊断中,在保持音频固定的情况下仅更改注入的先前情感标签,会将当前音频准确性从 72.50% 降低到 30.42%,并翻转 65.69% 的预测。该效应是强烈的标签不对称性,先验拉动范围从 4.76% 到 98.20%,揭示了我们称之为先前信念污染 (PBC) 的失败。为了解决 PBC,我们引入了 EmoUpdate,这是一个 无需训练 框架,它通过三个组件将当前音频感知与历史状态修订分开:(1)先验盲声防火墙,防止历史状态进入感知; (2)证据收缩的因果信念过滤器,仅在观察形成后引入历史,并仅在观察到的证据支持时保留标签不对称转换结构; (3) 从防火墙不可用的服务堆栈的相同反事实测量得出的封闭式净化操作符。在四个 SpeechLM 和两个流式情感基准测试中,EmoUpdate 在所有八个模型基准设置中实现了最佳的步进精度和状态平衡精度,与最强的受控基线相比,S-BAcc 提高了 69.71 点,步进精度提高了 38.41 点。