论文

LLM 可以模拟新手程序员的误解吗?

Can LLMs Simulate Novice Programmers' Misconceptions?

模型评测应用与实践模型能力评测编程

摘要

我们评估了 13 个关于生成、解决、模拟和诊断新手编程对代码跟踪问题的误解的LLM。虽然前沿模型可靠地执行这些任务,但小型模型 ($\le$14B) 却难以动态执行。值得注意的是,代码调整模型在错误概念模拟期间会通过恢复正确的执行而失败。最后,正确/错误格式的误解诊断比开放式生成任务要容易得多。