论文
用于文本介导的视频异常检测的决策读出:Jev 和 Qwen 的探索性评估
Decision Readouts for Text-Mediated Video Anomaly Detection: An Exploratory Evaluation of Jev and Qwen
摘要
当视频衍生的文本证据固定时,判决读出有多重要?我们在来自 UCF-Crime 和 XD-Violence 的 40 个视频和 400 个目标锚点的稀疏开发样本中评估 Jev 键入的决策和三个 Qwen 读数,每个样本都以摘要和有序标题的形式呈现。每个数据集贡献 20 个源组和 200 个锚点,分别仅包括 10 个和 37 个正样本。最初的 5 个后端试点要求 4,000 个预测;根据该研究严格的数字策略,Jev Choice 在 800 份回复中返回了 776 份有效回复,阻碍了其全面覆盖的质量比较。在 XD 字幕上,Jev Noul 的平均精度为 75.99%,而 Qwen 生成概率的平均精度为 48.47%,更强的局部序数似然期望的平均精度为 57.81%。后者配对差异为 18.18 个百分点(95% 源组引导区间 5.53-31.50)。 UCF 没有表现出相应的优势:Noul 的 ROC-AUC 为 52.26%,序数似然为 65.95%。两个概率读数的 UCF Brier 分数都比评估患病率参考值 0.0475 更高,因此更差。我们还审核了完全匹配的锚点上的历史 LAVAD 分数,并区分响应结构和数值一致性。缺少二元似然控制。这些探索性离线结果表征了排名、概率质量和界面故障;它们既没有建立因果类型接口的好处,也没有建立一般的优越性、校准或端到端加速。