论文

CFMME 上的大型视觉语言模型基准测试:综合中国金融多模态评估数据集

Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset

模型评测基准与评测资源

摘要

大视觉语言模型 (LVLM) 的出现极大地扩展了模型功能,超越了仅文本理解的范围,实现了跨视觉和文本模式的统一推理,并支持更广泛的现实世界应用。为了全面评估中国背景下LVLM在整个金融业务流程中的感知、理解、推理和认知能力,我们引入了一种新颖的中国金融多模态评估基准CFMME。 CFMME 包含 6,052 个实例,涵盖从基础学术知识到复杂的现实应用,涵盖八种主要金融图像模式和四种核心多模式任务。在 CFMME 上,我们对代表性 LVLM 进行了全面评估。结果表明,最先进的模型在问答任务上的总体准确率达到 66.11%,在检测、识别和信息提取任务上的平均得分为 77.18,表明当前 LVLM 仍有很大的改进空间。此外,我们对错误原因、跨模式能力和多方向设置进行详细分析,为未来的研究提供有价值的见解。我们希望 CFMME 将推动 LVLM 取得进一步进展,特别是提高其在金融领域多种多模式任务上的性能。