论文
Theia:无数据 蒸馏 的 Incidents1M 数据集的大规模多模态描述生成和自动验证
Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation
摘要
在灾害管理等关键领域部署视觉语言模型 (VLM) 需要高质量的多模式数据集,特别是通过无数据 知识蒸馏 (DFKD) 传输知识。然而,该领域的现有数据集要么完全缺乏描述性文本,例如 Incidents1M,要么存在严重的文本图像语义错位,例如 CrisisMMD。在这项工作中,我们提出了一种新颖的方法来构建和自动验证用于灾难响应的大规模多模式数据集。从仅视觉的 Incidents1M 开始,我们成功恢复了 100,000 张图像,并使用两种不同的 Qwen3.5 架构生成了高保真文本描述:4B 密集模型和 35B 专家混合 (MoE) 模型。为了确保生成的图像描述为 DFKD 提供可靠的语义锚定,我们引入了利用 Qwen3.5-9B 的图像盲 LLM-as-a-Judge 验证管道。通过故意模糊判断者的原始图像,该评估器准确地模拟了学生模型在无数据 蒸馏 期间的模态差距。我们对 173,179 个标签对的评估表明两种架构之间具有高度语义一致性 (78.65/100)。此外,自动评估揭示了保守的描述生成行为,其特点是高精确度(77.6%)和低召回率(46.0%)。这最大限度地减少了误报噪声,同时暴露了原始 真值 中潜在的人类注释不一致之处。这项工作提供了一个可扩展的、经过 LLM 验证的多模态数据集和一个可重复的框架来推进跨模态 知识蒸馏。