论文
M3-ACE:通过多智能体上下文工程修正多模态数学推理中的视觉感知
M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering
摘要
多模态大语言模型近期在视觉数学推理方面展现出可喜进展。然而,其性能往往受制于一个关键却未被充分研究的瓶颈:视觉感知不准确。通过系统分析,我们发现大多数失败源于视觉证据提取的错误或不完整,而非推理能力的不足。此外,模型往往对初始感知过度自信,使得提示工程、多轮自我反思或后验引导等标准策略不足以可靠地纠正错误。为解决这一局限,我们提出M3-ACE,一个旨在修正多模态数学推理中视觉感知的多智能体上下文工程框架。我们的方法不直接聚合最终答案,而是通过动态维护一个以视觉证据列表为中心的共享上下文来解耦感知与推理。多个智能体协作贡献互补的观察结果,使系统能够暴露不一致之处并找回缺失的感知信息。为支持稳定的多轮协作,我们进一步引入两个轻量工具:Summary Tool将不同智能体的证据整理为一致、互补与冲突三类组件,Refine Tool则过滤不可靠样本并引导迭代修正。大量实验表明,M3-ACE在多个基准上显著提升视觉数学推理性能。我们的方法在MathVision基准上建立了89.1的新最优结果,并在包括MathVista与MathVerse在内的其他相关数据集上取得一致提升。这些结果凸显了以感知为中心的多智能体协作对推进多模态推理系统的重要性。
