论文

UT-AIST 提交 ICME 2026 学术文本到音乐生成大挑战

UT-AISTimprt submission for ICME 2026 Grand Challenge on Academic Text-to-Music Generation

应用与实践内容创作

摘要

这项工作研究了在低数据和小规模模型设置下训练文本到音频音乐生成过程中批量采样策略的效果。本文介绍了我们针对 ICME 2026 学术文本到音乐生成大挑战的方法和发现。使用文本嵌入或音频嵌入对训练数据进行聚类,并将具有相似特征的样本分组在同一小批量中以减轻梯度干扰。分析了模态和聚类粒度对聚类的影响。结果表明,基于文本嵌入的聚类在客观评估指标上比基于音频嵌入的聚类具有更好的性能。此外,不同的聚类粒度会导致不同评估标准的不同行为:适量的聚类在客观指标上表现最佳,而大量的聚类往往会在听力测试中表现出具有更连贯结构的音乐。