论文
TeachObs:经过人类验证的多模式教学观察和模型评估基准
TeachObs: A Human-Validated Benchmark for Multimodal Teaching Observation and Model Evaluation
摘要
课堂视频包含可观察的教学实践,但其教学和视觉信号很少以适合模型评估的形式组织。我们提出了 \textit{TeachObs},这是一种经过人类验证的课堂视频中多模式教学观察基准。 \textit{TeachObs} 包括来自 8 个国家的 30 个公共课程视频,分为 5,158 个固定的 15 秒场景。七位研究人员用 39 个二进制观察代码对每个场景进行注释,涵盖 20 个视觉代码,如手势、棋盘工作、指向和视觉材料,以及 19 个非视觉代码,如指令、监控、提问、反馈和反思。黄金段标签是使用基于 Krippendorff alpha 的可靠性和流行度感知规则构建的。除了分段级别标签之外,三位专家评分者还对 30 节课程的教学设计、教学交付、学习者反应、学习材料和课程结束进行了课程级别评分和定性评估,评分者覆盖范围在正文中详细说明。使用这两个人类参考层,我们评估了三个轨道上的五个视觉功能前沿 LLM - 纯文本段编码、文本 + 帧段编码以及在 LLM 作为评判协议下评分的课程级覆盖率 - 并发现没有一个模型在所有三个轨道上始终优于其他模型,添加中帧会增加每个场景的真实和错误属性,并且模型评估会过度评估程序清晰与专家评估者相关的经验教训。因此,\textit{TeachObs} 支持细粒度注释基准测试和全课评估,显示人工智能系统在哪些方面可以协助课堂视频分析,以及在不同科目、课堂形式和注释难度级别上仍然需要专家判断。