论文

Raven:通过视频评估重新思考 Scratch 程序的自动评估

Raven: Rethinking Automated Assessment for Scratch Programs via Video-Grounded Evaluation

模型评测评测方法与指标

摘要

Scratch 等基于块的编程环境广泛用于入门计算教育,但可扩展且可靠的自动化评估仍然难以实现。 Scratch 程序高度异构、事件驱动且基于视觉,这使得传统的基于断言或基于测试的评分变得脆弱且难以扩展。因此,真实的 Scratch 课堂中的评估仍然严重依赖于手动检查和延迟反馈,从而导致教师之间的不一致并限制了可扩展性。我们推出了 Raven,这是一种 Scratch 的自动化评估框架,它用所有学生提交的内容中共享的教师指定的任务级视频生成规则取代了特定于程序的状态断言。 Raven 将 大语言模型 与视频分析集成,以评估程序观察到的视觉和交互行为是否满足评分标准,而不需要明确的测试用例或预定义的输出。尽管实施策略和交互顺序存在很大差异,但这种设计可以实现一致的评估。我们在 13 项真实的 Scratch 作业中对 Raven 进行了评估,其中包括 140 多个学生提交的作业,这些作业来自人类评分者,带有 真值 标签。结果表明,Raven 在不同编程风格的评分准确性和稳健性方面均明显优于之前的自动化评估工具。 30名学生和10名教师的课堂研究进一步证明了强大的用户接受度和实际适用性。总之,这些发现凸显了任务级行为抽象对于开放式、事件驱动程序的可扩展评估的有效性。