论文

VidParse:像专业人士一样在线解析第一视角活动流程

VidParse: Online Parsing of Egocentric Procedures Like a Pro

模型推理推理搜索与路径规划

摘要

将连续的、嘈杂的以自我为中心的视频流转换为离散的、按时间顺序排列的动作步骤充满了视觉挑战。严重的自我运动、短暂的遮挡以及无脚本的人与对象交互的高类内变异性导致标准帧级在线时间模型陷入困境,通常导致严重的过度分割和结构崩溃。为了弥合不稳定的底层感知和高级程序逻辑之间的差距,我们提出了 VidParse,这是一个在线 无需训练 框架,它将活动理解视为图约束推理问题。我们不依赖学习的时间过滤器,而是使用操作锚定特征上的时间相似性矩阵来动态识别语义转换,这些特征是从冻结的基础模型中提取的,以优先考虑前景手部物体交互。然后,波束搜索解码器利用诱导程序任务图来明确强制有效的动作转换并修剪不可能的轨迹。通过将鲁棒的视觉片段锚定到严格的程序约束,我们的方法保留了远程状态转换,并在复杂的多步解析精度方面比强大的在线基线提高了 10 倍,所有这些都不需要单个梯度更新。