论文

用于长尾自我中心错误检测的理解增强模型协作

Understanding-Enhanced Model Collaboration for Long-Tailed Egocentric Mistake Detection

应用与实践视觉感知与空间理解

摘要

在本报告中,我们解决了根据以自我为中心的视频数据确定用户是否错误地执行操作的问题。为此,我们提出了一种理解增强模型协作方法(UE-MCM),它将高效的粗粒度视频理解与准确的细粒度动作推理相结合。具体来说,UE-MCM包含小模型分支和大模型分支。大模型分支关注细粒度动作本身是否执行错误,而小模型分支联合以粗粒度视频和细粒度片段作为输入,识别可能局部正确但与整体工作流程不一致的动作。小模型分支构建在 CLIP4CLIP 视频编码器上,该编码器从通过扩散对比重建增强的 CLIP 模型初始化,而大模型分支使用 Qwen3-VL 嵌入模型从细粒度动作片段中提取高容量表示。然后,小分支预测和大分支预测通过轻量级协作门自适应地融合。为了处理错误实例的长尾分布,我们优化了具有互补目标的分类器,包括重新加权交叉熵、面向 AUC 的学习和标签感知调整。由此产生的系统平衡了速度和准确性,使其能够有效地检测以自我为中心的教学视频中微妙、罕见和模糊的错误。