论文

Zero-MELO:使用多模态 LLM 进行测试时间证据校准,实现零射击微手势识别

Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition

模型推理推理验证与自校正

摘要

虽然多模态 大语言模型 (MLLM) 在一般视频理解方面表现出色,但它们在细粒度和以运动为中心的任务中的能力仍然有限。这种限制在微手势识别(MGR)中尤其重要,其中微手势(MG)——微妙的、持续时间短的、空间局部的人类运动——作为隐性情感分析的关键判别信号,但在常见的提示实践中很容易被忽视。尽管 MGR 已通过许多判别性方法进行了深入研究,但 MLLM 在 MGR 中的应用尚未得到充分探索,其性能明显较差。我们假设 MLLM 的运动敏感表示能力受到其固有的单遍前向推理的限制,而这种能力可以通过精心设计的测试时指导来大幅增强。受此启发,基于我们之前关于视频 LLM 中时间不敏感的发现,我们诊断了负对数似然 (NLL) 空间中的零样本 MGR 错误。我们观察到 MLLM 面临两个瓶颈:1)本地化证据不足;2)由语言和运动不可知的外观驱动的严重评分偏差。因此,我们提出了一种新颖的测试时证据校准框架,可以提高推理细节和预测可靠性。具体来说,我们引入了一种树搜索机制来逐步获取局部的、细粒度的视觉证据,再加上一个测试时间校准模块来减轻分数偏差。然后,多线索融合模块整合来自多个线索的证据,而不依赖于单个线索进行最终预测。我们的框架在 iMiGUE 上实现了 26.84% 的平均类准确度,在 MA-52 上实现了 22.10% 的平均类准确度,显着优于 Qwen2.5-VL 基线,后者分别产生了 16.15% 和 10.20%。该代码将在 https://zero-melo.github.io/Zero-MELO 上提供。