论文

用于课堂参与识别的零样本视觉语言模型:提示灵敏度和跨数据集泛化的基准研究

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

模型评测模型能力评测

摘要

自动化课堂参与识别为可扩展的学习分析带来了巨大的希望,但现代视觉语言模型 (VLM) 在零样本条件下完成这项任务的适用性在很大程度上尚未得到探索。我们提出了一个系统基准,评估五个广泛使用的 VLM:CLIP、BLIP-VQA、GPT-4o、LLaVA-1.5-7B 和 Qwen2.5VL-7B-Instruct,跨两个互补的教育数据集:DAiSEE、单个学生视频数据集(300 个采样测试剪辑)和学生课堂行为数据集(SCB,1,168 个场景级图像)。每个模型都通过三种提示变体进行了探索,涵盖最小化、标题锚定和思维链设计。我们的实验揭示了用于参与识别的零样本 VLM 的三种主要故障模式:(1)个别学生的近乎随机表现,科恩在 DAiSEE 上的 kappa 从未超过 0.10; (2) 严重的类别崩溃,无论视觉内容如何,​​模型都会将 85-100% 的预测分配给单个参与级别; (3) 极高的提示灵敏度,仅取决于提示措辞,相同图像上的准确度波动高达 32 个百分点。值得注意的是,SCB 上的场景级分类要容易得多:当使用基于行为的评分标准进行提示时,CLIP 和 GPT-4o 的 kappa 值约为 0.60。我们还记录了部署的实际障碍:GPT-4o 的安全过滤器拒绝 98% 涉及个别学生面孔的思维链请求。我们的研究结果为在教育观察系统中使用 VLM 提供了校准基线和表面关键设计考虑因素。