论文
使用多模态进行大规模视觉识别的分而治之推理 大语言模型
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
摘要
多模态 大语言模型 (MLLM) 在广泛的视觉语言任务中展示了强大的功能。然而,当应用于大规模图像分类时,随着标签空间的扩展,它们的性能显着下降,我们将这种现象定义为长序列识别中的性能崩溃。通过信息论分析,我们揭示了这种崩溃源于不断上升的信息熵与注意力机制中显着的注意力稀释和衰减之间的根本冲突,这损害了模型在处理极长提示时保持足够的信噪比的能力。为了缓解这一问题,我们提出了分而治之推理 (DCI),这是一种用于使用 MLLM 进行视觉识别的新型测试时间缩放策略。 DCI 将复杂的全局分类任务递归地分解为多个更简单的局部子问题,并采用动态剪枝机制来压缩搜索空间。该方法通过缓解长序列推理中固有的权重稀释问题,有效提高了局部信噪比和模型精度。此外,虽然传统的自注意力会产生令人望而却步的二次计算复杂性,但 DCI 实现了更有利的缩放行为,并大大加速了大规模分类场景中的推理。在 ImageNet-1K 和 ImageNet-21K 等基准测试上进行的大量实验表明,DCI 持续提高了分类精度。这使得轻量级开源模型无需任何额外的训练或 微调 即可与前沿闭源巨头相媲美甚至超越。作为一种与模型无关的即插即用范例,DCI 提供了一种有效的方法来扩展大规模场景中 MLLM 的推理精度。