论文

用于鲁棒跨数据集图像分类的 MLLM 路由异构集成

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

智能体系统Agent 工具调用

摘要

现代图像分类模型在针对单个任务特定数据集进行训练时表现出色,但通常难以跨领域和难度级别进行泛化。我们提出了 ARMDIL,一种使用 LLM 进行多域图像分类的自适应路由器。 ARMDIL 是一个集成,它使用多模态 大语言模型 (MLLM) 代理将每个图像动态路由到最合适的视觉主干。我们多样化的集成采用卷积神经网络 (ResNets)、自监督表示学习器 (SSL) 和视觉语言模型 (VLM),每个模型都在由具有不同分布和特征的多个图像数据集构建的统一标签空间上进行训练。实证评估阐明了跨不同视觉领域的每种架构的独特功能和漏洞。至关重要的是,我们证明了 ARMDIL 有效地应对了这些权衡,与基于专门训练的路由器相比具有竞争力。此外,它允许通过简单的提示修改来集成新信息,同时通过自然语言推理痕迹增强可解释性,从而极大地提高了适应性。跨数据集图像分类的这些进步为更可靠的通用视觉系统(例如人工智能助手和自主机器人)铺平了道路。