论文

一次字幕、按需帧:用于预算意识代理长视频理解的视觉需求路由

Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding

上下文与知识上下文工程

摘要

边缘设备上的长视频理解必须在计算和带宽预算紧张的情况下推理数小时的内容。对视觉标记进行二次采样会丢失时间结构,而纯文本视频内存会丢失细粒度的视觉属性。我们观察到视觉文本二元性:语言记忆比密集帧更好地承载长程时间结构,而像素对于属性级感知仍然具有决定性作用。基于这一见解,我们提出了 Caption-once、Frames-onDemand (CFD),这是一种预算敏感的边缘云代理框架。边缘运行单个离线字幕通道,构建双轨叙事索引、事件级故事骨架以及剪辑级微日志,在查询中缓存和重用,无需重新字幕。在查询时,云端 MLLM 在以轻量级视觉需求路由器为中心的故事优先循环中对索引进行推理:每个查询的门控模块仅针对感知问题(外观、屏幕文本、属性消歧)触发有界关键帧检索,并将时间结构问题保留在语言空间中。该路由器将视觉访问转变为一流的查询条件成本,无论视频长度如何,都限制每个查询的帧消耗。长视频基准的实验证明了强大的准确性与效率权衡,同时大大减少了在线视觉处理。