论文

用于监控异常分类的联合二进制门控与服务器端视觉语言推理

Federated Binary Gating with Server-Side Vision-Language Inference for Surveillance Anomaly Classification

AI 基础设施推理服务

摘要

隐私敏感的监控系统可以受益于大型视觉语言模型(VLM),但此类模型通常需要集中访问原始视频。在联邦学习设置中,非独立且同分布(非 IID)的客户端数据会放大这一挑战,这可能会使直接多类异常分类不稳定,尤其是对于稀有类别。我们提出了一种混合两阶段架构,它将联合二进制卷积神经网络 (CNN) 门与服务器端零样本 VLM 推理相结合。轻量级 LiteCNN3D 门执行局部异常筛选,并仅将标记的视频转发到 Qwen3-VL-8B,后者将它们分配给四个异常元类。我们在 UCF-Crime 上评估此设计,分为五个粗略元类,并在真正的三节点异构部署中实现联合阶段。在研究的设置中,直接联合多类训练崩溃了,而所提出的分解在分类质量和原始视频传输之间产生了更好的权衡。通过固定阈值路由,联邦混合管道保留了与其集中式 CNN+VLM 对应物几乎相同的宏平均 F1 分数 (F1-macro),同时将传输视频的比例减少到 51.4%,尽管代理宏接收器曲线下工作特征面积 (ROC AUC) 低于集中式混合系统。互补的敏感度导向的路由操作点将宏 ROC AUC 从 0.673 增加到 0.692,并将误报率从 29.3% 降低到 22.9%,但将 F1 宏从 0.503 降低到 0.485,同时将传输率从 51.4% 增加到 57.9%。这些结果表明,联合更适合粗略的本地筛选,同时可以调整路由规则,以牺牲服务器端 VLM 的使用来获得更高的异常敏感度。