论文

扩大跨方法、格式和输入的音频问答的不确定性估计

Broadening Uncertainty Estimation for Audio Question Answering Across Methods, Formats, and Inputs

模型评测鲁棒性、公平性与可信度评测

摘要

音频语言模型可以产生不受音频支持的自信答案,从而激发不确定性估计来识别不可靠的响应。我们比较了四个开放权重模型和五个音频 QA 基准的基于概率、基于采样、自我验证、证据和对比措施。在多项选择评估中,第一个标记的度量总体上最强,top-1 概率的平均 AUROC 为 0.740,而十个样本离散语义熵的平均 AUROC 为 0.708,同时不需要额外的模型调用。在四个基准中,从多项选择转向开放式评估将平均准确度从 57.6% 降低到 36.6%,但不确定性仍然可以预测错误:语义熵、最大词元熵和语义一致性的平均 AUROC 分别为 0.697、0.694 和 0.693。为了测试不确定性是否反映了可用于回答问题的证据,我们执行输入消融,删除音频或问题。在 top-1 置信度、熵和基于采样的度量中,删除音频将错误检测 AUROC 平均减少 0.101,而删除问题时则减少 0.010。这些结果共同建立了有效的不确定性基线,并表明音频语言模型中的不确定性更多地取决于可用的音频证据,而不是问题文本。