论文
评估大语言模型在图论已解与未解问题上的表现:对计算教育的启示
Evaluating Large Language Models on Solved and Unsolved Problems in Graph Theory: Implications for Computing Education
摘要
大语言模型正越来越多地被学生用于探索计算机科学中的高阶内容,包括图论。随着这些工具融入本科与研究生课程,理解它们能在多大程度上可靠地支持严格的数学思维十分重要。本研究考察了一个LLM在两个相关图论问题上的表现:一个是关于线图优美性的已解问题,另一个是目前尚无解答的开放问题。我们采用一个体现真实数学探究的八阶段评估协议,包括解释、探索、策略形成与证明构造。该模型在已解问题上表现强劲,给出了正确的定义、识别出相关结构、无幻觉地回想起恰当的结果,并构造出经图论专家确认的有效证明。对于开放问题,该模型生成了连贯的解释与看似合理的探索性策略,但未能向解答推进。它没有捏造结果,而是承认了不确定性,这与指示模型避免发明定理或无支撑论断的明确提示指令相一致。这些发现表明,LLM能够支持对既有内容的探索,但在需要新颖数学洞见或批判性结构推理的任务上仍然有限。对计算教育而言,这一区别凸显了引导学生将LLM用于概念探索、而在正式解题中依靠独立验证与严谨论证的重要性。