论文

重新审视生成式人工智能在面向对象编程入门评估中的表现:2026 年的见解

Revisiting the Performance of Generative Artificial Intelligence on Introductory Object-Oriented Programming Assessments: Insights from 2026

模型评测模型能力评测

摘要

生成人工智能(GenAI)的最新进展极大地提高了 大语言模型(LLM)生成和解释源代码的能力。然而,他们在真实的面向对象编程(OOP)评估中的表现仍然没有得到充分的了解。本研究使用大学 OOP 入门课程中的编程测试和考试任务,评估了五种广泛使用的 GenAI 系统:ChatGPT-5.2、DeepSeek-V3、Gemini 2.5 Flash、Claude Sonnet 4.5 和 M365 Copilot。使用适用于学生的相同评分标准对生成的解决方案进行评估,并与同一课程的历史学生成绩以及上一年的结果进行比较。还分析了常见错误,以确定跨模型反复出现的局限性。所有接受评估的 GenAI 系统都取得了比普通学生组更高的分数,并且经常在较长的编程任务中获得满分。然而,他们偶尔会生成无法编译的代码,并继续努力解决高级 OOP 概念,特别是接口、抽象类和某些与继承相关的任务。在涉及图像解释的图形相关问题上,成绩也受到限制。与前一年相比,评估的系统在大多数评估中都表现出显着的改进,同时表现出几种重复出现的错误模式。研究结果对当代 GenAI 系统在真实的介绍性 OOP 评估方面的能力和局限性提供了最新的评估。他们还提供了证据,可以为编程评估的设计、GenAI 工具负责任地集成到软件工程教育中以及评估人工智能辅助编程的演变的未来研究提供信息。