论文

划分、深思熟虑、决定:细粒度自我中心行为识别的多智能体框架

Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition

智能体系统Agent 协作

摘要

以自我为中心的视频中的细粒度动作识别对于视觉语言模型(VLM)来说是一个挑战:动作通常仅在小的视觉线索上有所不同,并且单个模型往往会偏向于这些线索的子集。我们提出了 Divide、Deliberate、Decide,这是一个完全本地、零样本的多智能体框架,其中(i)VLM 协调器对视频进行分块,并为每个片段提出前 k 个候选标签列表,(ii)来自不同开放模型系列的异构 VLM 专家组成的整体,参与包括一轮同行咨询问题的结构化审议,以及(iii)智能体排名与 Borda 计数汇总,协调器重新排名根据专家的证据做出自己的预测。整个管道在本地运行,没有 微调。实验表明,我们的方法在基线上积极提高了零样本动作识别性能,突出了异构审议步骤的影响,表明增益源于去相关模型先验,而不是来自额外的计算。