论文

DialBGM:面向日常多轮对话的背景音乐推荐基准

DialBGM: A Benchmark for Background Music Recommendation from Everyday Multi-Turn Dialogues

模型评测基准与评测资源

摘要

选择支持自然人类对话的合适背景音乐(BGM)是媒体和交互系统中常见的制作环节。本文提出对话条件BGM推荐任务:模型需要为通常不包含音乐描述词的多轮对话选择不打扰、契合的音乐。为研究这一新问题,我们提出DialBGM基准,包含1,200段开放域日常对话,每段对话配以四个候选音乐片段并标注人类偏好排序。排序由背景适宜性标准决定,包括情境相关性、非打扰性和一致性。我们评估了广泛的开放源码与专有模型,包括音频语言模型和多模态LLM,结果显示当前模型远不及人类判断;在选择排序最高的片段时,没有模型超过35%的Hit@1。DialBGM为开发面向BGM选择的语篇感知方法以及评估检索式与生成式模型提供了标准化基准。

DialBGM:面向日常多轮对话的背景音乐推荐基准:论文配图
图 1:对话条件 BGM 推荐。给定多轮对话和大规模音乐片段数据库,系统使用对话作为上下文过滤器对候选者进行排名,并选择与对话最匹配的背景音乐(BGM)。