论文
利用视觉语言模型检测教育视频中的注意力
Leveraging Vision-Language Models to Detect Attention in Educational Videos
摘要
教育视频是远程和混合学习的基石。然而,学习者注意力的波动仍然是有效信息保留的重大障碍。先前的研究试图通过使用眼动追踪来检测运行时注意力的丧失并做出反应来减轻这种情况。迄今为止,此类检测基于受工程特征训练的经典机器学习分类器,例如学习者注视和扫视的汇总统计数据。这些方法很难捕捉学习者参与的复杂性、时间性,因此表现出中等的预测性能。在这项研究中,我们的目标是通过从标准工程特征转向多模态基础模型来推进注意力的检测。使用教育眼动追踪数据集 (N = 70),我们研究了一种新颖的方法,该方法利用视觉语言模型 (VLM) 直接通过叠加的注视数据分析视频内容。这种方法旨在利用基础模型的语义推理功能将学习者的注意力集中在视频流中。我们使用 Gemini 3 的几种提示策略来评估这种基于 VLM 的方法的性能,但最终发现它们都无法超越统计基线。我们的结果为使用 VLM 进行实时教育诊断的局限性提供了新的见解。