论文

拟声图像的音像跨模态检索

Audio-Image Cross-Modal Retrieval with Onomatopoeic Images

摘要

在多媒体制作中,寻找与创作者的预期印象相匹配的音效或环境声音仍然是一个主要的手动过程。这对于漫画和其他视觉媒体尤其重要,其中视觉风格化的拟声表达通过字母形状、笔画、布局和装饰图案传达听觉印象。然而,拟声图像和一般声音之间的跨模态检索在很大程度上尚未被探索。因此,本文介绍了拟声图像和相应声音片段之间的双向检索框架。我们不是直接比较从预训练图像和音频编码器中提取的嵌入,而是训练特定于模态的投影头,这些投影头重新对齐视觉象声词和相应声音的嵌入。然后,我们构建了多模态图像音频拟声数据集 (MIAO),其中包含 50 个声音事件类的成对拟声图像和声音片段。实验结果表明,所提出的方法大大优于使用预训练的 CLIP 和 CLAP 嵌入的零样本基线。这些结果表明,采用预训练的表示可以实现两个方向的有效检索:从拟声图像到声音以及从声音到拟声图像。