论文
使用指令调整和反馈驱动的调整使 MusicLLM 与情感保持一致
Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment
摘要
本文研究了音乐 大语言模型 (MusicLLMs) 是否可以用于情感回归。虽然 MusicLLM 在音乐信息检索任务中表现出强大的性能,但它们预测唤醒和效价分数的能力仍然有限,因为情绪回归并不是明确的训练目标。为了检查 MusicLLM 是否可以与情感保持一致,我们对 MusicLLM 进行情感回归训练,并比较两种策略:指令调整和反馈驱动的对齐。我们的实验表明,任务感知指令调整使 MusicLLM 能够在一定程度上预测情绪水平,尽管准确性仍然有限。与单独的指令调整相比,应用反馈驱动的对齐与可验证的数字奖励可以显着提高唤醒和效价的性能。我们进一步表明,我们的方法提高了情绪回归性能,同时保持了 MusicQA 能力。