论文
无需训练 多模态密集手部接触估计 大语言模型
Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models
摘要
密集的手部接触估计需要高级语义理解和人类交互的细粒度几何推理,以准确定位接触区域。最近,多模态 大语言模型 (MLLM) 在理解视觉语义方面表现出了强大的能力,这得益于从大规模数据中学习的视觉语言先验。然而,利用 MLLM 进行密集的手部接触估计仍有待探索。将 MLLM 应用于密集手部接触估计存在两个主要挑战。首先,编码显式 3D 手部几何形状很困难,因为 MLLM 主要在视觉和语言模式上运行。其次,捕获细粒度的顶点级接触仍然具有挑战性,因为 MLLM 倾向于关注高级语义而不是详细的几何推理。为了应对这些挑战,我们提出了 ContactPrompt,这是一种使用 MLLM 进行密集手部接触估计的 无需训练 和零样本方法。为了有效地编码 3D 手部几何形状,我们引入了详细的手部分割和部分顶点网格表示,以提供结构化的局部几何信息。为了实现准确高效的密集接触预测,我们开发了一种具有零件调节功能的多阶段结构化接触推理,逐步桥接全局语义和细粒度几何。因此,我们的方法有效地利用了 MLLM 的推理能力,同时实现了精确的密集手部接触估计。令人惊讶的是,所提出的方法优于之前在大规模密集接触数据集上训练的监督方法,而无需任何训练。代码将被释放。