论文
MATA:面向多智能体视觉推理的可训练分层自动机系统
MATA: A Trainable Hierarchical Automaton System for Multi-Agent Visual Reasoning
摘要
近期的视觉语言模型具有很强的感知能力,但其隐式推理难以解释,且在复杂查询上容易产生幻觉。组合式方法提升了可解释性,但大多依赖单智能体或手工流水线,无法决定何时在互补智能体间协作或在重叠智能体间竞争。我们提出MATA(Multi-Agent hierarchical Trainable Automaton),一个表现为分层有限状态自动机的多智能体视觉推理系统,其顶层转移由可训练的hyper智能体选择。每个智能体对应hyper自动机中的一个状态,并运行一个小型基于规则的子自动机以实现可靠的微观控制。所有智能体读写共享内存,产生透明的执行历史。为监督hyper智能体的转移策略,我们构建转移轨迹树并将其转化为记忆到下一状态对,形成用于监督微调(SFT)的MATA-SFT-90K数据集。微调后的LLM作为转移策略,理解查询和各智能体的能力,能够高效选择最优智能体解决任务。在多个视觉推理基准上,MATA相较单体和组合式基线取得最先进结果。代码和数据集发布于 https://github.com/ControlNet/MATA。
