Agogic:用于 LLM 原生文本到符号音乐生成的演奏时序音乐词元
Agogic: Performance-Timed Music Tokens for LLM-Native Text-to-Symbolic-Music Generation
摘要
文本到音乐的语言模型通常从默认的选择开始:如何标记音乐。通常与骨干网、数据和配方纠缠在一起,其效果从未被孤立地衡量过。我们修复了预训练的 Qwen3.5 (0.8B-27B)、数据、预算和解码,并仅交换七个标记化的表示,将纹理度量锚定到每个表示的无模型上限。排序是干净且令人惊讶的:表示,而不是模型大小,是分布保真度的绑定变量。将骨干网缩放 34 倍几乎不会改变 Frechet Music Distance (FMD),而切换表示则将其减半。 PMT 是我们发布的性能分辨率流(10 毫秒计时、每音符速度、多轨纹理;609 个符号),在 0.8B 时达到 FMD 159,而节拍网格为 272-286(低 1.7-1.8 倍,其他地方高达 2.8 倍;非重叠引导 CI),因此 0.8B 性能分辨率模型击败了 27B 节拍网格。它重新出现在 26M 的从头开始的骨干网和第二个性能分辨率分词器上:类的属性,而不是一个幸运的词汇表。它也不是一个更精细的晶格伪像:将 PMT 的起始点与节拍网格的分辨率对齐仍然使其比两者领先 67-129 FMD (n=500)。效果是分布式的;是否能听到是一个单独的问题,我们的探测器尚未解决这个问题,并已预先注册了人类研究。原生音乐描述依从性较弱,但可分离:轻量级解码时间约束使 Instrument-F1(0.28 至 0.60)和 Correct-Key(0.16 至 0.35)加倍,且无需分配成本。我们发布了该工具、超过 25 个检查点、两个语料库(86.6k 跨音乐描述/MIDI/ABC/音频对齐;6.25M 音乐描述,最大的音乐)和一个印记诊断:已发布的文本到 MIDI 系统再现了其训练分布,与音乐描述几乎不变(不相交域上的和弦时间为 72% 与 71%)。该领域的下一个代表性主张现在可以衡量,而不是断言。