论文
高速视觉提高了对人类行为的零样本语义理解
High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions
摘要
从视觉观察中理解人类行为对于人机交互至关重要,特别是当需要对不熟悉或难以注释的行为进行语义解释时。在快速和不太常见的活动等场景中,为监督学习收集足够的标记数据具有挑战性,这使得零样本方法成为无需特定任务训练的语义理解的实用替代方案。虽然大规模预训练模型的最新进展使得这种零样本推理成为可能,但时间分辨率的影响,特别是对于快速和细粒度运动的影响,仍然没有得到充分探索。在这项研究中,我们研究了时间分辨率如何影响高速人类动作的零样本语义理解。使用剑道作为快速和微妙运动模式的代表案例,我们提出了一种 无需训练 管道,它将用于语义表示的预训练视频语言模型与用于成对动作比较的基于 大语言模型 的推理相结合。通过跨多个帧速率(120 Hz、60 Hz 和 30 Hz)的受控实验,我们表明更高的时间分辨率显着提高了零样本设置中的语义可分离性。我们进一步分析了基于跟踪的人体联合信息在完整和部分观察场景下的作用。使用最近类原型策略的定量评估表明,高速视频为快速动作提供了更稳定和可解释的语义表示。这些发现强调了时间分辨率在 无需训练 动作识别中的重要性,并表明高速感知可以增强语义理解能力。