论文
CaVe-VLM-CoT:可解释视觉语言模型框架
CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework
摘要
视觉语言模型(VLM)仍易幻觉——产出流畅但视觉不忠实的输出。既有思维链与检索增广方法仅部分解决该问题——因为它们既不强制步级引用锚定——也不把验证失败路由回检索以纠正。我们呈现CaVe-VLM-CoT——模块化、基于反思的智能体RAG框架——经五阶段闭环管线强制证据锚定推理:抽取器、检索器、求解器、引用注入器与验证器——其中检出的无根据声明触发结构化反馈给抽取器做定向再检索。由于既有框架没有联合测量检索质量、逐步引用忠实性与跨模态锚定——我们提出覆盖全部阶段的23个组件级指标套件——以CaVeScore为锚——加权准确率、引用精确率与召回、归因及证据锚定的复合指标。不做任何架构或提示修改——CaVe-VLM-CoT在ScienceQA上取得87.1%准确率与56.6% CaVeScore——在MMMU(30科目)上取得55.2%准确率与35.7% CaVeScore。
