论文
MicroWorld:赋能多模态 大语言模型 通过多模态属性图弥合微观领域差距
MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph
摘要
多模态 大语言模型 (MLLM) 在科学推理方面显示出巨大的潜力,但它们在显微镜等专业领域的性能仍然受到特定领域训练数据的稀缺以及将细粒度专家知识编码到模型参数中的困难的限制。为了弥补这一差距,我们引入了 MicroWorld,这是一个框架,它从大规模科学图像 - 描述语料库构建多模态属性图 (MAPG),并利用它在推理时增强 MLLM 推理,而无需任何特定领域的 微调。 MicroWorld 通过基于 scispaCy 或 LLM 的三元组挖掘来提取生物医学实体和关系,使用 Qwen3-VL-Embedding 在共享嵌入空间中对齐图像和实体,并组装一个包含大约 111K 个节点和跨越八个关系类别的 346K 类型边的知识图。在推理时,图形增强检索管道将查询实体与 MAPG 相匹配,并将结构化知识上下文注入 MLLM 提示中。在MicroVQA基准上,MicroWorld将Qwen3-VL-8B-Instruct的推理性能提高了37.5%,比GPT-5提高了13.0%,达到了新的state-of-the-art。此外,它在 MicroBench 基准测试中的性能提升了 6.0%。大量的实验证明了 MicroWorld 引入的增强的泛化能力。定性案例研究进一步揭示了结构化知识改善推理的机制以及指向有希望的未来方向的失败模式。代码和数据可在 https://github.com/ieellee/MicroWorld 获取。