论文
BodyCam-VQA:通过多模态推理和探测问题生成增强执法记录仪视频字幕
BodyCam-VQA: Enhanced Body-Worn Camera Video Captioning via Multimodal Reasoning and Probe Question Generation
摘要
警察随身摄像机 (BWC) 录像已成为执法的一个重要方面,可确保法律透明度、警官问责和保护公民权利。然而,由于其多模态视频格式,有效处理这些数据仍然是一个重大挑战。在许多情况下,BWC 视频包含视觉质量低下、快速移动/交互和高噪声音频的混乱场景,这使得视觉理解甚至对 SOTA 多模态模型都构成挑战。当前的视觉语言模型(VLM)经常忽视关键的取证细节,例如有价值的证据的存在或嫌疑人与警官互动的潜在细微差别,这对于公平的法律结果和平民/警官的安全至关重要。为了解决这些限制,我们提出了一种专为高风险执法而设计的自适应视觉问答(VQA)框架。我们的框架采用结构化推理方法来提取传统字幕系统无法捕获的细粒度视觉证据。我们尝试了多个问题生成模型,包括基础模型和微调开放权重模型,以观察问题生成模型实现之间的性能变化。我们的结果表明,这种 VQA 驱动的架构提供了更可靠、客观和详细的执法事件记录,最终成为通过人工智能辅助取证清晰度保护执法人员和公众的强大工具。