论文
LEAP:用于长音频-视频感知的学习分块证据检索
LEAP: Learned Block-wise Evidence Retrieval for Long Audio-Video Perception
摘要
小时尺度的视听问答受到上下文困境的限制:密集的全记录编码迅速耗尽上下文限制,而均匀的时间压缩严重稀释了细粒度的声学和视觉证据。我们引入了 LEAP,这是一个框架,模型可以检索自己的证据,而无需将整个记录放在一个上下文中。 LEAP 将记录划分为固定持续时间的块,对每个块应用轻量级定位传递以对短候选窗口进行评分。排名最高的窗口被汇集并在单个有界答案传递中重新编码。因此,答案输入和峰值上下文保持独立于记录持续时间。通过将证据定位与推理分离,我们的框架可以在预先计算的转录本上定位候选时间窗口,而无需解码媒体帧,同时通过在原始视听流上路由最终应答传递来保留细粒度的视觉和非语音证据。 LEAP 训练两个阶段:定位 LoRA 改进了选定的窗口,答案 LoRA 改进了从同一窗口读取的答案。块网格本身支持因果查询,使 LEAP 能够支持流推理,而无需进行特定于流的训练。在多个 AVQA 基准测试中,LEAP 比 Qwen3-Omni-30B-A3B 基线提高了 4.5-16.8%,并转移到第二个全模态主干 MiniCPM-o 4.5,比其公布的结果高出 3.1-13.0%。