通过精心编排的视觉模型进行零样本零售盗窃检测:与模型无关的、经过训练的单模型系统的经济有效的替代方案
Zero-Shot Retail Theft Detection via Orchestrated Vision Models: A Model-Agnostic, Cost-Effective Alternative to Trained Single-Model Systems
摘要
零售盗窃每年给全球经济造成超过 1000 亿美元的损失,而现有的基于人工智能的检测系统需要在专有数据集上进行昂贵的定制 模型训练,并且每家商店每月收费 200-500 美元。我们提出了 Paza,一种零样本零售盗窃检测框架,无需训练任何模型即可实现实用的隐藏检测。我们的方法在分层管道中编排多个现有模型 - 持续运行廉价的对象检测和姿势估计,仅在行为预过滤器触发时调用昂贵的视觉语言模型(VLM)。与每帧分析相比,多信号可疑预过滤器(需要停留时间加上至少一个行为信号)将 VLM 调用减少了 240 倍,将调用限制为 <=10/分钟,并使单个 GPU 能够为 10-20 个存储提供服务。该架构与模型无关:VLM 组件接受任何 OpenAI 兼容端点,使操作员能够在 Gemma 4、Qwen3.5-Omni、GPT-4o 或未来版本等模型之间进行交换,而无需更改代码 - 确保系统随着 VLM 环境的发展而改进。我们在 DCSASS 合成入店行窃数据集(169 个片段,受控环境)上评估 VLM 组件,在 59.3% 的零样本召回率下实现 89.5% 的精度和 92.8% 的特异性,其中召回率差距可归因于离线评估中的稀疏帧采样,而不是 VLM 推理失败,因为精度和特异性是确定误报率的操作关键指标。我们提出了一个详细的成本模型,显示每家商店每月 50-100 美元的可行性(比商业替代品便宜 3-10 倍),并引入了一种隐私保护设计,可以在检测管道中混淆人脸。源代码可在 https://github.com/xHaileab/Paza-AI 获取。