论文

SAFIRE:多模式中细粒度火灾和烟雾理解的安全关键基准 LLM

SAFIRE: Safety-Critical Benchmark for Fine-grained Fire and Smoke Understanding in Multimodal LLMs

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在视觉语言任务方面取得了巨大进展,但其在安全关键环境中的可靠性仍有待探索。对火灾烟雾的理解对于公共安全和灾难响应至关重要,但大多数现有基准缺乏多样化的现实场景和情境感知评估。我们引入了 SAFIRE,这是 MLLM 中火烟理解的大规模基准,包括来自 20 个场景的 83K 个带字幕的图像和从 9.7K 图像子集生成的 193K 多项选择 VQA (MCVQA),跨越从基本感知到高阶推理的 10 个评估维度。 GPT-5.4 辅助的多阶段验证管道和 MLLM 多数投票可确保注释质量。评估 10 个开源 MLLM (8B-38B) 的平均准确度为 61.9%,暴露了安全关键推理中的主要差距。我们进一步表明,仅使用 7% 的特定领域数据来调整视觉编码器即可将火灾场景分类准确率从 20.1% 提高到 64.5%,这表明即使数据量有限,精心策划的数据也可以产生巨大的收益。所有数据集、模型和代码均可在 https://risys-lab.github.io/SAFIRE/ 上获取。