论文
为视觉语言模型的家庭视频自闭症筛查加入确定性证据层
A Deterministic Evidence Layer for Vision-Language Autism Screening from Naturalistic Home Video
摘要
自闭症谱系障碍 (ASD) 是通过对儿童社会行为的专业观察来诊断的,而获得专业知识是早期识别的瓶颈。视觉语言模型(VLM)可以很好地描述视频中孩子的行为;从描述中得出的结论是不稳定的:在温度~0时,在一个主干上的八个管道配置中,16--37%的剪辑在重复运行之间改变了它们的预测标签,原因在于服务堆栈。我们保持 VLM 冻结并将决策移出模型。在我们扎根的感知约束下,VLM 编写了一个事件表,其中包含带时间戳、术语表标记的事件,其中列出了引发媒体的名称并记录了反证据;纯文本阶段年龄校准每行的置信度;确定性证据权重评分器将其汇总为证据总数并将其分层为风险类别,因此每个决策都分解为指定的每个特征贡献,并且可以从保存的表中重新评分。在 43 个由护理人员录制、无协议的学龄前儿童家庭自由玩耍片段中,管道在三轮运行中达到 AUC $0.851 \pm 0.012$、86.0\% 准确度和 F$_1$ 71.8。它在每次运行中正确标记 74.4% 的剪辑(零样本基线为 60.5%),并在每次运行中标记没有典型发展的剪辑(零样本时 31 个中的 9 个)。同一主干上的消融将增益归因于通过确定性评分器读取的Grounding感知约束。
