论文

AgentFinVQA:可部署的金融图表问答多智能体管线

AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA

智能体系统Agent 架构与控制循环

摘要

受监管环境下的金融图表问答要求的不只是准确率:从业者在据此行动前必须知道哪些答案可信——且许多机构无法把客户数据发给外部模型提供商。但既有图表QA智能体以准确率为中心且不透明——多数假设专有API访问;据我们所知——没有一个在不显著牺牲准确率的情况下兼具可审计性与本地可部署性。我们呈现AgentFinVQA——把每个查询分解为规划、OCR、图例锚定、视觉检查与验证的多智能体管线——每样本在可追溯的模型评估包(MEP)中记录每一步。在FinMME上——AgentFinVQA较骨干匹配的零样本基线以专有骨干(Gemini-3 Flash)提升+7.68pp(71.24%对63.56%,McNemar p≈1.1×10⁻¹⁶)——以本地部署的开放权重Qwen3.6-27B-FP8提升+4.84pp。验证器的裁决也是有用置信信号(确认答案与修订答案的精确准确率68.2%对55.6%)——支持人机协同审查路由。错误分析显示问题误解、图例混淆与抽取错误占失败近三分之二——且是验证器最难检出的类别——指明未来方向。这些结果共同表明:可审计、本地部署的金融图表QA切实可行——开放权重系统保留大部分准确率增益同时实现完全数据驻留。我们发布代码支持可复现评估。

AgentFinVQA:可部署的金融图表问答多智能体管线:论文配图
图 1:AgentFinVQA 纠正 FinMME 堆叠票据大小图表上的零样本过度选择。 Zero-shot 列出了 2018 财年至 2022 财年 10k-25k 部分超过 40% 的情况,而 AgentFinVQA 独立验证每个 MCQ 选项,排除 39.6% 的 23 财年,并返回准确答案:2018 财年 + 19 财年 + 2020 财年。