论文

CaVe-VLM-CoT:可解释视觉语言模型框架

CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework

智能体系统Agent 架构与控制循环

摘要

视觉语言模型(VLM)仍易幻觉——产出流畅但视觉不忠实的输出。既有思维链与检索增广方法仅部分解决该问题——因为它们既不强制步级引用锚定——也不把验证失败路由回检索以纠正。我们呈现CaVe-VLM-CoT——模块化、基于反思的智能体RAG框架——经五阶段闭环管线强制证据锚定推理:抽取器、检索器、求解器、引用注入器与验证器——其中检出的无根据声明触发结构化反馈给抽取器做定向再检索。由于既有框架没有联合测量检索质量、逐步引用忠实性与跨模态锚定——我们提出覆盖全部阶段的23个组件级指标套件——以CaVeScore为锚——加权准确率、引用精确率与召回、归因及证据锚定的复合指标。不做任何架构或提示修改——CaVe-VLM-CoT在ScienceQA上取得87.1%准确率与56.6% CaVeScore——在MMMU(30科目)上取得55.2%准确率与35.7% CaVeScore。

CaVe-VLM-CoT:可解释视觉语言模型框架:论文配图
图 1:CaVe-VLM-CoT 管道概述。多模态问题及其图像位于左侧。提取器 (unsloth/Qwen2.5-7B-Instruct-bnb-4bit) 将问题分解为路由到本地知识库和实时 Web 搜索的子查询;检索到的块和输入图像传递到求解器 (LLaVA-CoT),该求解器会生成结构化推理轨迹。引文注入器通过交叉编码器匹配填充未引用的声明,验证器 (Qwen2.5-VL-32B) 审核每个引文。在检测到幻觉时,结构化反馈返回到提取器以进行另一次检索尝试,循环直到推理得到验证或重试预算耗尽。