论文
用冻结视频编码器和微调MusicGen生成游戏配乐
Video-to-Music Generation for Gameplay Videos
摘要
近年来,视频到音乐模型取得明显进展,尤其在电影和音乐视频应用中。本文研究视频游戏领域,它带来新的挑战:画面是渲染图形,音乐主要为合成音频,配乐往往在整个关卡循环,而不是跟随屏幕事件。我们提出新数据集,包含217.6小时Super Nintendo(SNES)游戏视频,配对485小时无音效、无旁白的纯配乐,并通过音频指纹与游戏音频匹配。在此数据上,我们训练一个简单编码器解码器Transformer,将视频特征直接送入MusicGen解码器,比较文本描述T5、独立帧ViT和时空块ViViT三种编码策略。每个编码器分别测试冻结与微调,解码器始终微调。冻结编码器在所有指标上达到或超过其微调版本,冻结ViViT整体最好。我们通过客观指标与96人听感研究,将该模型与先进基线比较。尽管参数最多少18%,模型在客观指标上超过全部基线,在听感研究中优于GVMGen,与OSSL相当。