论文
用于联合弱监督视频异常检测的无解析器 VLM 验证
Parser-Free VLM Verification for Federated Weakly Supervised Video Anomaly Detection
摘要
当监控数据仍然分散、标记弱且资源有限时,视觉语言模型如何帮助视频异常检测(VAD)?大多数弱监督 VAD 方法都采用集中式训练;最近基于 VLM 的扩展进一步依赖于密集推理、生成的解释或额外的适应。我们引入了一种轻量级联合 MIL-VLM 级联,其中仅跨客户端训练紧凑的 MIL 评分器,而冻结的 VLM 则事后验证高分可疑片段。我们研究了两个 VLM 反馈接口:解析文本生成决策和基于 logits 的接口,该接口从下一个标记是/否概率中提取连续异常分数。使用 InternVL3.5-2B 和 Qwen3-VL-2B-Instruct 对 UCF-Crime 进行的实验表明,文本生成验证可以在诊断时间后处理后提高帧级 AUC,但对提示、解析器、模型选择和平滑仍然敏感。相比之下,logits 接口提供固定的无解析器信号,可在两个 VLM 的 MIL 基线上改进帧级 AUC 和帧级 AP,而无需在其主要配置中进行时间后处理。由于可疑片段一旦可用就会独立更新,因此下一个词元 logits 反馈为文本生成验证提供了一种简单的局部片段替代方案。