论文

通过紧凑的潜在多代理协作扩展视频理解

Scaling Video Understanding via Compact Latent Multi-Agent Collaboration

智能体系统Agent 协作

摘要

多模态 大语言模型 (MLLM) 可以促进视觉语言理解,但由于感知上下文预算有限,在长视频任务中面临固有的限制。现有的代理方法通过基于规则的预处理来缓解这一问题,但通常会遭受信息丢失、成本高昂以及对文本中间体的依赖。我们提出了 MACF,一种端到端的多智能体协作框架,它将每个智能体的感知预算与全局视频复杂性分离,实现可扩展的视频理解,同时保持视觉保真度。 MACF 将视频划分为本地预算代理的片段,并通过代理本机潜在通信协议实现整体推理。每个代理将部分观察结果编码为共享嵌入空间中紧凑的、任务充足的标记,从而允许中央协调器进行高效且保留信息的协作。我们引入了一种课程训练策略,逐步加强语义对齐、证据总结和跨代理协调。对不同视频理解基准的大量实验表明,在相同的预算限制下,MACF 始终优于最先进的 MLLM 和多智能体系统,这证明了我们在可扩展视频理解方面的潜在协作的有效性。