论文

HIVE:以假设生成与核验增强多模态推理检索

HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval

上下文与知识检索增强

摘要

面对需要将图表、示意图或截图与文本深入结合的推理型查询,多模态检索模型表现不足。在MM-BRIGHT上,最佳多模态模型的nDCG@10仅为27.6,低于强纯文本检索器的32.2。本文提出HIVE,即假设驱动的迭代视觉证据检索,一个通过大模型向检索器引入显式图文推理的即插即用框架。HIVE分为四步:初始语料检索;大模型根据前k个候选中的视觉和逻辑缺口生成补偿查询;使用改写查询二次检索;对合并后的候选核验并重排。在MM-BRIGHT的多模态到文本赛道、覆盖29个技术领域的2,803条真实查询中,HIVE聚合nDCG@10达到41.7,比最佳纯文本模型DiVeR的32.2高9.5分,比最佳多模态模型Nomic-Vision的27.6高14.1分。其中,推理增强基础检索器达到33.2,HIVE框架再增加8.5分,在游戏、化学和可持续发展等视觉要求较高的领域表现突出。HIVE兼容普通和推理增强检索器,表明由大模型生成视觉假设并核验,可明显缩小检索中的多模态推理差距。代码:https://github.com/mm-bright/multimodal-reasoning-retrieval。