论文
M2Note:通过错误笔记本学习不断进化视觉语言模型
M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning
摘要
视觉语言模型 (VLM) 在多模态推理任务中表现出了卓越的能力,但它们仍然会反复出现故障,例如跳过关键的视觉检查、误用领域规则以及产生不受支持的概念。大多数现有解决方案依赖于有监督的 微调 (SFT) 和强化学习 (RL),它们的迭代成本很高,并且在分布转移下可能很脆弱。为此,我们提出了多模态错误笔记本学习(M2Note),这是一种 无需训练 持续进化框架,可将学习外化为可编辑的记忆。 M2Note 将失败的轨迹转换为紧凑的主题指导说明:主题总结了基础领域和概念,而指南提供了可在未来推理中重复使用的可操作的验证步骤。在测试时,M2Note 通过多模态检索增强生成 (RAG) 检索相关笔记,并将其附加到模型上下文中,从而引导推理避开之前观察到的陷阱。为了稳定持续发展,我们采用带有回滚功能的批次级后验证,只有当笔记本编辑提高了同一批次的性能时,才会提交笔记本编辑,从而减少噪音更新并防止回归。 M2Note 支持自我进化(其中相同的 VLM 充当求解器和监督器)和跨模型进化(其中更强的监督器引导较弱的求解器),从而无需权重更新即可实现能力转移。对六个多模态推理基准的实验表明,跨领域和主干网得到了一致的改进,同时实现了强大的成本和样本效率,并与思想链 (CoT) 提示保持互补。