论文

FoodMonitor:对 MLLM 进行可解释合规性分析的基准测试

FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis

模型评测基准与评测资源

摘要

随着人工智能驱动的合规监控在公共治理和工业安全中变得越来越重要,提供可验证证据和可追溯问责信号的能力至关重要。然而,现有的视频异常检测数据集侧重于事件级二元分类,缺乏现实合规场景所需的规则驱动、可解释的分析。我们推出 FoodMonitor,这是商业厨房监控中可解释的合规性分析的基准。 FoodMonitor 采用双通道设计,包含 477 个视频剪辑和 3,307 个违规注释,涵盖人员级别和环境级别的违规行为。每个注释都指定违反了哪条规则、发生了哪些不合规行为以及谁使用帧级边界框提交了该行为。我们建立了一个统一的评估协议,具有两阶段匹配机制,分别评估空间定位和语义理解,以及平衡环境和人员检测性能的复合指标($C_{\text{score}}$)。对几个最先进的多模态 大语言模型 的系统评估表明,性能最佳的模型仅达到 0.360 $C_{\text{score}}$,空间定位和细粒度规则理解成为主要瓶颈。我们的分析确定了两种不同的故障模式:本地化主导的错误和语义主导的错误,为未来的模型开发提供诊断见解。