论文
KIRA:专业视觉领域的知识密集型图像检索和推理架构
KIRA: Knowledge-Intensive Image Retrieval and Reasoning Architecture for Specialized Visual Domains
摘要
检索增强生成(RAG)已经改变了基于文本的问答,但其向视觉领域的扩展仍然受到基本挑战的阻碍:弥合图像查询和文本重知识库之间的模态差距,构建语义上有意义的视觉知识库,对检索到的图像执行多跳推理,以及验证生成的答案是否忠实地基于视觉证据。我们提出 KIRA(知识密集型图像检索和推理架构),这是一个统一的五阶段框架,解决专业领域视觉 RAG 的十个核心问题。 KIRA 介绍了:(1) 具有基于 DINO 的区域检测的分层语义分块,用于多粒度知识库构建;(2) 具有针对稀有视觉概念的少样本适应的域自适应对比编码器;(3) 具有 chainOfThought 查询扩展的双路径跨模态检索;(4) chainOfRetrieval,用于具有时间和多视图支持的多跳视觉推理;(5) 具有事后幻觉验证的证据条件基于证据的生成。我们还提出了 DOMAINVQAR,这是一个基准套件,它沿着三个轴(检索精度、推理 忠实性 和域正确性)评估视觉 RAG,超越标准召回指标。跨四个专业领域(医学 X 射线、电路图、卫星图像和组织病理学)的实验采用渐进式六变体消融,表明 KIRA 实现了 0.97 的检索精度、1.0 的证据依托评分和 0.707 跨领域平均域正确性,而消融揭示了关于每个组件何时提供帮助以及何时组件引入必须管理的精确多样性权衡的可操作见解。代码将在接受后发布。