论文
我们还有多远? LLM 与人类专家数学建模竞赛的系统评价
How Far Are We? Systematic Evaluation of LLMs vs. Human Experts in Mathematical Contest in Modeling
摘要
大语言模型 (LLM) 在推理基准测试中取得了强劲的性能,但其解决需要端到端工作流程的现实问题的能力仍不清楚。数学建模竞赛为评估这种端到端问题解决能力提供了严格的测试平台。我们提出了一个面向问题的分阶段评估框架,该框架使用专家验证的标准评估整个建模阶段的 LLM 性能。我们通过将自动得分与独立人类专家对中国研究生数学建模竞赛问题的判断进行比较,验证了该框架的可靠性,表明比现有评估方案具有更强的一致性。使用这个框架,我们揭示了最先进的 LLM 中的理解与执行差距:虽然它们在问题识别和制定等早期阶段表现良好,但在模型求解、代码实现和结果分析等面向执行的阶段表现出持续的缺陷。即使模型规模增加,这些差距仍然存在。我们进一步将这些失败追溯到规范不足、缺少验证和缺乏验证,错误在没有纠正的情况下跨阶段传播。我们的研究结果表明,弥合这一差距需要模型扩展之外的方法,为应用 LLM 解决复杂的现实世界问题提供见解。