论文

用于多模态理解、生成和编辑的认知结构多模态代理

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

智能体系统Agent 架构与控制循环

摘要

最近的统一多模态模型表明,单一架构可以联合执行视觉/语言理解和图像生成/编辑。然而,它们重复地将所有历史视觉和文本输入输入到共享上下文窗口中,由于视觉标记爆炸和不可靠的交叉引用而限制了长视野多模式对话。我们提出了一种认知结构的多模式代理,它将视觉信息外化为情景视觉记忆,并在推理过程中选择性地重新激活相关情景。该代理由用于结构化视觉抽象的感知抽象引擎、用于跨回合记忆检索的认知检索引擎以及用于自主任务推理和行动规划的多模态执行控制器组成。为了解决现有数据集中缺乏回合级检索监督的问题,我们开发了一个统一场景引擎,可以通过编程方式生成带有细粒度检索注释的结构化多回合对话,从而使强化学习能够优化抽象和检索策略。我们还构建了一个按难度分层的长视野视觉对话基准,以评估情景视觉回忆。我们的 8B 代理在 20 轮会话中实现了 91.4% 的检索准确率,比 32B 基线高出 8.2%,同时每轮推理时间几乎减半(23.1 秒 -> 12.7 秒)。我们进一步提出了认知结构多模态代理Harness(CMA-Harness),这是同一认知结构的工具增强部署,集成了持久多模态记忆、网络访问、图像生成/编辑/合成工具和 OpenAI 兼容服务。与单一参数缩放相比,结构化内存和模块化决策为长视野多模式代理提供了更具可扩展性、更高效的范例。代码:https://github.com/caseclose/cma-harness;项目页面:https://caseclose.github.io/cma-harness/