论文

从框架到时间图:使用视觉语言模型进行上下文中的自我中心动作识别

From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

上下文与知识上下文工程

摘要

以自我为中心的视频中的动作推理需要捕获手部物体交互的细粒度转换,这是通用视觉语言模型(VLM)在直接对原始像素进行操作时经常遇到困难的任务。我们建议通过将视频转换为时间动作图来将视觉感知与符号推理分离。在多阶段提示管道中,我们首先在短时间窗口上生成密集的自然语言叙述作为语义瓶颈,然后将它们形式化为结构化的、开放词汇的图形表示。在 EGTEA 和 Epic-Kitchens-100 数据集上,符号表示解锁了高效的上下文学习:与零样本帧和基于图的推理相比,少样本图演示可带来显着的准确性提升。即使在零样本设置中,基于图的推理仍然与基于像素的推理具有竞争力,尽管潜在的预训练污染有利于后者。在来自 6 个模型系列(参数范围从 2B 到 235B)的 11 个开放权重 VLM 中,我们的研究结果表明,当前的 VLM 作为符号推理器比作为直接视觉观察者更有效。通过将视频投影到语言域中,我们提供了一种可扩展的、无 微调 的端到端方法替代方案,可以更好地利用这些模型的潜在推理优势。该代码将被公开。