论文
基于文本的人物异常搜索的动作对齐检索和成对多模态重排序
Action-Aligned Retrieval with Pairwise Multimodal Reranking for Text-Based Person Anomaly Search
摘要
基于文本的人员异常搜索需要根据细粒度、上下文相关的行为而不仅仅是外表来区分个体。现有的方法很难捕获这些上下文条件的动作,经常依赖于孤立的骨架几何形状,在重新制定过程中丢弃原始查询细节,或者利用绝对逐点评分进行多模式验证。为了解决这些限制,我们提出了 \textbf{ActPair},一个统一的三阶段从粗到细的框架,它将动作对齐检索与成对多模态重新排序相结合,以弥合姿势语义差距。首先,我们使用与动作相关的多任务目标来微调视觉语言模型(VLM),该目标鼓励表示对动作区分语义进行编码。其次,我们使用原始查询和 大语言模型 (LLM) 生成的基于上下文的重写来执行并行后期融合检索,保留两个语义视图中的互补细节。最后,我们提出了一种高效的现成重排序模块,该模块利用枢轴促进算法来执行直接的成对视觉比较,减轻残留空间和组成的模糊性,而无需进行详尽评估的令人望而却步的推理成本。大量的实验表明,我们的框架在行人异常行为(PAB)公共测试的比较方法中取得了最佳结果,并有效地转移到了看不见的、非异常特定的数据集。