论文
增强任何开源 MLLM 的部件级点定位
Enhancing Part-Level Point Grounding for Any Open-Source MLLMs
摘要
视觉定位旨在将自由形式的文本查询与图像中的特定区域相关联。虽然最近的多模态 大语言模型 (MLLM) 在该领域展示了有前途的功能,但它们主要擅长对象级定位,并且经常难以处理零件级定位——这是机器人操作等细粒度任务的基本要求。在这项工作中,我们介绍了一种通用方法,为任何开源 MLLM 配备精确的 2D 部件级点定位,为传统定位表示提供更直接的替代方案。我们的方法利用了 MLLM 中固有的注意力机制。通过所提出的 Q-Synth 模块在中间层中合成文本条件的定位感知查询,我们捕获与目标相关的注意力模式,并使用轻量级注意力到点解码器对其进行细化,该解码器将这些模式转换为以点为中心的热图以进行最终预测。值得注意的是,所有原始 MLLM 参数都被冻结,确保充分保留其预先训练的功能。实验表明,我们的设计持续提高了跨数据集的零件级定位精度,并且可以无缝集成到任何开源 MLLM 中。