论文

GMoT:利用多模态进行细粒度微手势视频推理的门控运动感知标记化 LLM

GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs

上下文与知识上下文工程

摘要

微手势识别需要检测短暂的、空间局部的运动,这些运动经常被主要的静态外观和背景噪音所淹没。虽然多模态 大语言模型 (MLLM) 擅长一般视频理解,但它们本质上难以处理微妙的运动学,并且通常依赖于静态姿势先验。为此,我们提出了 GMoT,一种门控运动感知标记化模块,可在时间建模之前将稀疏运动学证据显式地提取为紧凑序列。 GMoT 通过空间加权池动态聚焦动作相关区域,提取相邻帧时间差异以捕获精确的运动能量,并使用保守初始化的语义门将这些线索自适应地融合到视觉流中。为了从简单分类过渡到基于证据的推理,我们进一步引入了渐进式奖励引导的策略细化范例,并由半监督注释管道支持,该管道生成以解剖学为重点的标题。除了在 iMiGUE (67.32\%) 和 SMG (73.11\%) 上的比较方法中实现最佳 Top-1 准确率、将 Qwen3-VL-8B 基线提高 +6.80 和 +3.11 点之外,我们的框架引入了身体区域定位 (BRG) 召回作为以正确预测为条件的解剖区域依据对齐代理,以及 iMiGUE 和 SMG 之间的重叠标签跨域传输协议。广泛的评估表明,我们的 GMoT 增强模型提高了域内准确性,在保留标签的损坏下保留了明显的收益,并在明确的小分割警告下改进了面向准确性的跨域传输,同时在其生成的基本原理中保持了高度的解剖学基础。