论文

用于未修剪的自我中心视频的预算视觉语言字幕的预解码声学分类

Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video

上下文与知识上下文工程

摘要

自动分析长达数小时的以自我为中心的视频对于物流、建筑和制造领域的进度监控、质量控制和安全越来越重要。然而,当前使用视觉语言模型 (VLM) 处理短的、固定大小的窗口的管道非常昂贵,因为成本随着模型调用的数量而变化。为了降低此成本,先前的工作提出了分类策略来选择哪些窗口值得调用 VLM。然而,这些策略要么统一采样,要么使用视觉特征对窗口进行排名,讽刺的是,这需要预算限制本应避免的视频解码。我们提出音频优先分类:使用最轻的模态选择窗口,在解码任何视频帧之前进行评分,因此该方法自然地与词元压缩或量化结合在一起。新颖之处在于目标,而不是表示:我们训练选择器每个动作触发一次,而不是每帧声音事件检测器。这一目标转变使用冻结的 AudioSet 预训练功能,无需特定领域的声音事件标签,将所有评估呼叫率的动作覆盖率提高了 4.0-10.8 个百分点。该分类使用不到一半的可用调用,在 EPIC-KITCHENS-100 (EK-100) 上的匹配覆盖范围内减少了 9-20% 的 VLM 调用,超过了 Ego4D 上超过 247 个剪辑的中范围均匀采样,并且优于最近的两个视觉关键帧选择器。本手稿读取的代码、参考实现和每个结果文件位于 https://github.com/masjalayer/PreDecoding-AcousticTriage。