论文

连接粗略识别和精细识别:交互式教育游戏中开放式多粒度对象识别的混合方法

Bridging Coarse and Fine Recognition: A Hybrid Approach for Open-Ended Multi-Granularity Object Recognition in Interactive Educational Games

应用与实践视觉感知与空间理解

摘要

多模态 大语言模型 (MLLM) 的最新进展实现了开放式对象识别,但它们在处理细粒度任务方面遇到了困难。相比之下,CLIP 式模型擅长细粒度识别,但缺乏对一般对象类别的广泛覆盖。为了弥补这一差距,我们提出了 \textbf{HyMOR},一个 \textbf{Hy}brid \textbf{M}多粒度开放式 \textbf{O}bject \textbf{R} 识别框架,它将 MLLM 与 CLIP 模型集成在一起。在 HyMOR 中,MLLM 执行开放式和粗粒度的对象识别,而 CLIP 模型专门用于特定领域对象(例如动物和植物)的细粒度识别。这种混合设计可以跨多个语义粒度实现准确的对象理解,为下游多模式内容生成和交互式游戏玩法提供强大的感知基础。为了支持内容丰富的教育场景中的评估,我们引入了 TBO(TextBook Objects),这是一个包含 20,942 张图像的数据集,并标注了从教科书中提取的 8,816 个对象类别。大量实验表明,HyMOR 将与 CLIP 的细粒度识别差距缩小到 0.2%,同时将一般对象识别能力比基线 MLLM 提高了 2.5%(通过平均 Sentence-BERT (SBert) 相似度来衡量)。总体而言,HyMOR 在所有评估数据集上的平均 SBert 提高了 23.2%,突显了其在实现多模式游戏内容生成和交互式学习应用的准确感知方面的有效性。