论文

识别条件推理:用于细粒度微动作理解的 无需训练 多模态 LLM 管道

Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding

应用与实践通用理解与问答

摘要

微动作是微妙的、短暂的、低幅度的身体动作,例如坐立不安的手或轻微的头部倾斜,人类在几乎没有意识的情况下执行这些动作,但却可靠地泄露了情绪和心理状态。理解它们不仅仅是分配标签:模型还必须描述哪些身体部位在移动,并忠实地推理为什么剪辑需要特定的细粒度类别。我们提出了 无需训练,仅提示系统,该系统在 MAC~2026 微动作挑战赛的细粒度理解赛道(MA-Bench)中获得第一名,其中 微调 和 真值 监督均被禁止。该系统完全基于冻结的多模态 大语言模型 (MLLM) 构建,动态地将八个子任务中的每一个子任务路由到经验上最适合该任务的 MLLM:用于封闭式识别任务的判别性 MLLM 和用于开放式描述和推理任务的生成式 MLLM。该架构在开放式任务上实现了统计上显着的性能优势,平均得分为 2.68(五分制),而第二佳方法的平均得分为 1.44。