论文
LEGATO 2:迈向多模态乐谱识别和理解
LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding
摘要
我们提出了一种新颖的管道 Legato 2,用于从乐谱图像中提取符号符号和语义知识。 Legato 2 具有第一个用于光学音乐识别 (OMR) 的大规模神经模型,可以在逐个系统的基础上顺序运行,遵循在页面上读取的符号的水平线,而不是将页面视为无差别的图像,从而能够更好地缩放到任意长的输入。它也是第一个能够生成符号转录的 OMR 模型,其中包括嵌入的文本内容,例如标题和注释。该管道将系统级分割与自回归视觉LM相结合,以捕获局部符号细节和乐谱结构。在多个数据集上,Legato 2 始终优于现有技术水平。我们还表明,符号转录补充了前沿语言模型的视觉输入,改善了它们对密集音乐文档的解释。 Legato 2 在 OMR 和下游乐谱理解方面建立了新的最先进的性能。