论文
屏幕协作学习行为自动视频分析中的单智能体与多智能体对比
Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors
摘要
屏幕上的学习行为为了解学生在学习中如何搜寻、使用和创建信息提供了宝贵洞见。分析屏幕行为投入对于捕捉学生的认知与协作过程至关重要。视觉语言模型(VLM)的最新发展为自动化多模态视频数据分析中常需的劳动密集型人工编码提供了新机会。在本研究中,我们比较了领先的闭源VLM(Claude-3.7-Sonnet、GPT-4.1)与开源VLM(Qwen2.5-VL-72B)在单智能体与多智能体设置下,基于ICAP框架对协作学习情境屏幕录像进行自动编码的性能。我们特别提出并比较了两种多智能体框架:1)三智能体工作流多智能体系统(MAS),按场景切分屏幕视频,并使用结合光标信息的VLM提示与基于证据的验证来检测屏幕行为;2)受ReAct启发的自主决策MAS,迭代地交替进行推理、类工具操作(切分/分类/验证)与观察驱动的自我纠正,以生成可解释的屏幕行为标签。实验结果表明,两种MAS框架均取得了可行可用的性能,在场景与动作检测任务上优于单个VLM。值得注意的是,基于工作流的智能体在场景检测上表现最佳,而自主决策MAS在动作检测上表现最佳。本研究证明了基于VLM的多智能体系统在视频分析上的有效性,并为多模态数据分析贡献了一个可扩展框架。
