论文

考察LLM的解题能力——静力学题研究

Investigating LLM's Problem Solving Capability -- a Study on Statics Questions

模型评测模型能力评测

摘要

大语言模型 (LLM) 迅速影响了社会的许多方面,特别是教育,因为他们表现出完成广泛学科作业和考试的能力。尽管之前的研究已经检验了 LLM 的教育影响,但现有的大部分工作依赖于公共或开放问题数据集,并且缺乏针对特定主题的分析。在工程教育中,特别是在机械工程领域,针对特定问题类型的 LLM 性能的系统研究仍然有限。我们的研究没有使用直接向 LLM 工具询问教科书问题的传统方法,而是采用模型 蒸馏 过程来评估 LLM 解决静力学问题的能力。通过提炼 ChatGPT,我们提取了 25 个纯文本静态问题,并通过添加图表并修改其数值进一步构建了两个额外的数据集。实验结果表明,虽然 LLM 在纯文本静力学问题上表现良好,但当引入图表且问题需要多步推理时,其准确性会下降。进一步的分析表明,这种性能下降主要不是由图像识别的限制造成的,而是由多步骤推理以及在连续的解决方案阶段一致应用提取的视觉信息方面的困难造成的。