论文
AudioJev:具有阶次校准概率的直接音频决策
AudioJev: Direct Audio Decisions with Order-Calibrated Probabilities
摘要
音频决策通常取决于抄本未保留的证据,而其概率估计可能取决于答案选项的排序方式。 AudioJev 通过一个共享的全参数模型将波形、问题和提供的替代方案直接映射到候选分布。我们将顺序校准定义为在保留意义的选项排列下保留答案的概率。随机混乱 SKL 训练将每个问题与重新排序的视图配对,其中每个替代方案都会改变位置,监督两个答案,并在应用对称 KL 惩罚之前对齐两个分布。推理保留单个候选评分向前,没有校准头或顺序集合。在三个训练种子中,AudioJev 在完整 MMAU/MMAR 上达到了 68.88%/55.33% 的平均准确度,并且相对于单视图去除消融,随机顺序 SKL 降低了 43.8%/60.5%。同一模型可以处理意图、环境声音、音符属性、语音活动和对话转换。配对去除消融和多阶评估一起测量预测准确性和概率稳定性,建立一个直接音频接口,其校准目标作用于候选含义而不是呈现位置。推理代码和模型权重可在 https://github.com/SihanLv/AudioJev-Inference 和 https://huggingface.co/shlv/AudioJev. 获取