论文

面向端侧火情理解的视觉语言模型蒸馏

Distilling Vision-Language Models for On-Device Fire Understanding

摘要

视觉语言模型 (VLM) 通过推理场景的语义上下文,从而减少误报,为传统火灾探测系统提供了一种有前景的替代方案,但其较大的模型尺寸使得在嵌入式火灾传感器上的部署变得不切实际。在本文中,我们研究了如何压缩特定领域的 VLM 以实现完全设备上部署,同时又不丢失火灾检测所需的安全关键行为。我们开发了一个师生知识提炼框架,其中针对火灾理解进行微调的大型 VLM 可以提炼为轻量级的学生。跨多个 VLM 系列和模型规模的实验表明,紧凑的学生保留了大部分教师的火理解能力。我们进一步将提炼后的模型部署在我们的商用 Detectium 火灾探测传感器上,并共同评估推理准确性、延迟和内存使用情况。结果表明,压缩和部署不仅影响准确性,还影响模型故障模式,其中 Qwen2.5-0.5B 提供了最强的整体部署权衡。我们的研究结果为在资源有限、安全关键的环境中部署领域专用 VLM 提供了更广泛的指导。