论文

评估计算机科学大学数据结构考试中的 大语言模型

Evaluating Large Language Models on Computer Science University Exams in Data Structures

模型评测基准与评测资源

摘要

我们对 大语言模型 (LLM) 对计算机科学 (CS) 数据结构试题进行了综合评估。我们的工作引入了一个新的基准数据集,其中包含特拉维夫大学 (TAU) 的考试题,旨在评估 LLM 处理封闭式和多项选择题的能力。我们评估了 OpenAI 的 GPT 4o 和 Anthropic 的 Claude 3.5(流行的 LLM)以及两个较小的 LLM(Mathstral 7B 和 LLaMA 3 8B)在 TAU 考试基准中的性能。我们的研究结果让我们深入了解 LLM 目前在计算机科学教育方面的能力。