论文
JASTIN:通过自然语言指令对齐 LLM 的零样本音频与语音评测
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions
摘要
生成音频模型的快速发展已经超过了稳健评估方法的发展。现有的客观指标和通用多模态 大语言模型 (MLLM) 经常在领域泛化、零样本能力和指令适应性方面遇到困难。为了解决这些瓶颈,我们提出了 JASTIN,这是一种可泛化的、指令驱动的音频评估框架,它将音频评估制定为一项自指导推理任务。 JASTIN 通过可训练的音频适配器将冻结的高性能音频编码器与微调的 LLM 主干桥接起来。为了确保稳健的零样本泛化,我们引入综合的指令遵循数据准备流程,结合了多源、多任务、多校准和多描述数据。实验结果表明,JASTIN 与人类主观评分实现了最先进的 Pearson 和 Spearman 相关性。它在语音、声音、音乐和域外评估任务方面始终优于通用 MLLM,而无需进行特定于任务的再训练。