论文

AcoustiClaim:用仪器真值检验音频模型的数字主张

AcoustiClaim: A Numeric Claim Benchmark with Instrument Ground Truth

模型评测基准与评测资源

摘要

音频语言模型会给出声学量的数值,但人类意见或裁判模型都不能确认这些数值是否符合信号本身。AcoustiClaim从自由文本提取数值主张,使用定义相应声学量的测量工具评分,并按参考值可读取的位置对声学量分类。四个开放权重系统和一个闭源模型在两个语料库上,以五种问法回答十种声学量,形成207个评测单元。其中49个单元输出不足五种不同数值;可作排序分析的158个单元中,仅8个超过预设0.3秩相关阈值,只有3个的区间整体高于阈值,8个中有5个来自同一个闭源模型的音高读取。除三个单元外,误差均不低于常数预测器基线。作者训练的参考解码器在未另行扣留预测的情况下,对95%的混合音频以文字拒答五种语音量,而在对应干净音频上报告这些量,仅依靠音频复现训练目标的规则。通过校准阈值选择不输出部分预测后,混合音频上的十种量平均误差均下降,八种量在每个划分都下降;随机选择最多只改善0.6%。线性基线对误差的排序至少与该方法同样好。基频标准差和振幅微扰仍未优于常数预测基线。

同一录音在双说话人混合版与干净版上的两次分析,用仪器数值核对模型声学主张。
图1(图注摘要):同一录音在双说话人混合版与干净版上的两次分析,用仪器数值核对模型声学主张。