论文
通过音频感知 大语言模型 的细粒度反馈改进文本到音频指令的跟踪
Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models
摘要
最近的文本到音频模型可以生成高质量的音频,但通常无法遵循涉及多个声音事件和时间顺序的指令。出现这种差距的原因是现有的评估和训练信号主要强调全局相似性或感知质量,而对指令级正确性的监督有限。我们提出了一个指令级框架,使用音频感知 大语言模型 (ALLM) 作为细粒度判断器来验证生成音频中目标事件的存在和时间关系。在基准上验证 ALLM 判断并通过人工验证后,我们使用他们的反馈来构建偏好对以进行直接偏好优化。我们进一步介绍了 S3Bench,一个用于评估多事件时间指令跟踪的叙事基准。实验表明,我们的方法提高了现有基准和 S3Bench 上的事件完整性、时间顺序和联合指令跟踪准确性,同时保持了音频质量。