论文
MLLM 理解指向吗?自我中心视觉中的基准测试和增强参考推理
Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision
摘要
以自我为中心的人工智能代理,例如智能眼镜,依靠指向手势来解决自然语言命令中的引用歧义。然而,尽管多模态 大语言模型 (MLLM) 取得了进步,当前系统通常无法精确地确定指向的空间语义。相反,它们依赖于与视觉接近度或物体显着性的虚假相关性,我们将这种现象称为“参照幻觉”。为了解决这一差距,我们引入了 EgoPoint-Bench,这是一个全面的问答基准,旨在评估和增强以自我为中心的观点中的多模式指向推理。该基准包含超过 11,000 个高保真模拟和真实样本,涵盖五个评估维度和三个参考复杂度级别。大量的实验表明,虽然最先进的专有和开源模型与以自我为中心的指向作斗争,但根据我们的合成数据进行微调的模型实现了显着的性能提升和强大的模拟到真实的泛化。这项工作强调了空间感知监督的重要性,并为实现精确的以自我为中心的人工智能助手提供了一条可扩展的路径。项目页面:https://guyyyug.github.io/EgoPoint-Bench/