论文

VISTA:使用视觉语言模型的密集多标签课堂编码

VISTA: Dense Multi-Label Classroom Coding with Vision-Language Models

模型评测基准与评测资源

摘要

视频语言基准通常由数据集作者构建,没有发布可靠性统计数据,使得构建的本底噪声未知。我们认为,多模式基准测试受益于研究界采用的方法,这些研究界已经投资了确保可靠性的策略。我们用本科生 STEM 课堂观察协议 (COPUS) 来说明这个案例:一个 24 代码多标签观察工具,包含十年来经过同行评审的可靠性文献。我们将 COPUS 重新打造为多模式基础模型的视频基准,它提供了一组密集的结构化标签(在 50-90 分钟的讲座中每 2 分钟提供一个 24 维二进制向量)、经过外部验证的词汇表以及基于人类评估者提供每个代码可靠性目标的既定文献。我们的评估语料库中的注释是由 5 人评估小组生成的,其共识矩阵是我们的参考。我们提出了 VISTA,这是一个在密集滑动窗口上运行 MiniCPM-V-4.5 的基线,通过在冻结主干上训练的轻量级多层感知器 (MLP) 头来细化其每个窗口的输出,并将结果预测最大池化到 2 分钟 COPUS 网格上。在三个举行的化学讲座中,VISTA 的受限宏观准确度达到 80.1%,而零样本变体的准确度为 74.9%,在视觉上相似的讲师代码和罕见的音频相关代码上具有最大的残余误差。我们描述了三种系统故障模式(音频部分可观察性、细粒度小组工作歧视、长尾召回),并在 https://github.com/ajfranck/VISTA 上发布了基准工具、提示和基线代码。