论文

以人为本:根据人类偏好进行高效 LAM 评估

Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment

模型评测评测方法与指标

摘要

大型音频模型 (LAM) 的快速增长需要有效的模型比较方法,但全面的基准测试成本高昂。为了填补这一空白,我们研究最小子集是否可以可靠地评估 LAM,同时降低成本和数据冗余。通过分析涵盖主要 LAM 评估维度的 40 个任务中的 18 个音频模型的 10 种子集选择方法,我们发现仅 50 个示例(数据的 0.3%)的子集就可以实现超过 0.93 的 Pearson 相关性和完整的基准分数。为了了解这些分数与从业者最终关心的用户满意度的吻合程度,我们从真实的语音助手对话中收集了 776 个人类偏好评级,发现子集和完整基准与人类的相关性仅为 0.85。为了更好地预测偏好,我们在这些选定的子集上训练了回归模型,实现了 0.98 的相关性——优于在随机子集和完整基准上训练的回归模型。这表明,在回归建模中,精心策划的子集的预测结果优于完整的基准,显示质量胜于数量。我们开源这些回归加权子集作为 HUMANS 基准,这是 LAM 评估的有效代理,可捕获基准性能和用户偏好。