论文
SeePhys Pro 的多智能体辩论和视觉信息提取:ICML 2026 AI4Math Track 3 挑战赛第一名技术报告
Multi-Agent Debate and Visual Information Extraction for SeePhys Pro: A 1st-Place Technical Report from ICML 2026 AI4Math Track 3 Challenge
摘要
本技术报告介绍了我们在第三届人工智能数学研讨会上挑战 Track~3:SeePhys Pro 的方法,其任务是回答大学水平的物理问题,其陈述和图形可能部分或全部以图像形式给出。当决定性信息位于图形而不是文本中时,视觉物理问题对于 大语言模型 来说变得更加困难,并且随着更多问题迁移到图像中,这种模态差距扩大。我们使用两阶段框架来解决该任务:视觉信息提取阶段将图形内容重新表达为求解器可读文本以缩小模态差距,推理阶段通过多智能体辩论协调三个异构求解器。我们的分析得出两个结论:编排的收益来自可靠的答案选择,而不是额外的辩论,并且图形辅助的价值与问题被锁定在图像内的程度成正比。由此产生的管道在公共分类上将单智能体基线的整体准确率从 0.643 提高到 0.802,并在公共和私人排行榜上都获得了第一名(私人整体 0.743)。