论文
通过归纳演绎推理增强多模式情境学习
Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning
摘要
上下文学习 (ICL) 允许大型模型使用几个示例来适应任务,但其对视觉语言模型 (VLM) 的扩展仍然脆弱。我们的分析表明,根本的限制在于归纳差距,模型经常从有缺陷的推理中产生正确的答案,同时努力在演示中提取一致的规则。两个视觉层面的障碍进一步加剧了这种差距:压倒性比例的冗余视觉标记掩盖了文本线索,以及倾斜的注意力分布,有利于初始图像而牺牲了后续上下文。为了解决这些问题,我们引入了一个框架,将多模态 ICL 重组为有原则的归纳演绎过程。该框架包含一个基于相似性的视觉标记压缩模块来过滤掉冗余补丁,一个动态注意力再平衡机制来在所有图像上公平地分配焦点,以及一个思想链范式,该范式明确指导模型分析单个示例,导出可概括的规则,然后将其应用于查询。辅助学习管道将监督式 微调 与强化学习相结合,使用可验证的奖励来加强忠实引用和噪声过滤。对涵盖视觉感知、逻辑推理、STEM 问题和讽刺检测的八个基准的评估表明,多个开源 VLM 比标准 ICL 基线有一致且显着的改进,凸显了在多模态环境中为模型配备真正的归纳能力的潜力。