论文
PLACE:通过条件嵌入进行位置潜在适应以生成双耳音频
PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation
摘要
我们提出了 PLACE,这是一种扩展预训练的任意音频模型 AudioX 的方法,用于从文本、视频和可选音频提示的任意组合生成双耳声音。 PLACE 通过感知编码器核心功能增强视频调节,对齐文本和视频表示以导出空间线索,并对生成的潜在变量应用依赖于调节的低秩变换。该适配器通过解码音频耳间电平和时间差目标进行监控。在 MRSAudio 上进行训练后,PLACE 在 FAIR-Play 上比 ViSAGe 改进了大多数指标,并在 BEWO-1M 单静态测试分割上比 SpatialSonic 实现了更高的 SpatialCLAP 分数。听众评价倾向于使用 PLACE 进行视频转音频和分发外文本转音频生成,展示了灵活的多模态控制和改进的空间一致性。