论文
AVSD-Scenes:城市场景视听描述数据集
AVSD-Scenes: A Dataset for Audio-Visual Description of Urban Scenes
摘要
自然语言描述可以提供视听城市场景的丰富语义表示,但共同描述听觉和视觉信息的数据集仍然有限。在本文中,我们介绍了 AVSD-Scenes,这是一个针对城市环境的配对视听场景描述数据集。该数据集包含从 TAU Urban Audio-Visual Scenes 数据集生成的 12,291 个视听场景描述。为了构建数据集,我们首先分别使用 Qwen2-Audio-7B 和 Qwen2.5-VL-7B 生成基于音频和视觉的描述。然后使用大语言模型(即 Qwen3-14B、Mistral-Small-3.2-24B-Instruct-2506 和 Gemma-3-27B-it)组合这些特定于模态的描述,以生成从两种模态捕获互补信息的多模态描述。我们使用语义对齐、跨模式检索、场景分类、大语言模型作为评审评估和人类主观评估来对 AVSD 场景进行基准测试。结果表明,与特定于模态的描述相比,多模态描述提高了语义对齐和跨模态检索性能,同时保留了强大的场景区分信息。生成的描述在城市场景分类中的准确率高达 94.5%,而结合音频、视觉和描述嵌入,进一步将准确率提高到 95.4%。此外,即使从提示指令中删除场景标签,描述仍然具有高度的场景辨别力,这表明它们捕获了从视听内容导出的语义信息,而不仅仅是反映标签信息。