论文
AgentFinVQA:可部署的金融图表问答多智能体管线
AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA
摘要
受监管环境下的金融图表问答要求的不只是准确率:从业者在据此行动前必须知道哪些答案可信——且许多机构无法把客户数据发给外部模型提供商。但既有图表QA智能体以准确率为中心且不透明——多数假设专有API访问;据我们所知——没有一个在不显著牺牲准确率的情况下兼具可审计性与本地可部署性。我们呈现AgentFinVQA——把每个查询分解为规划、OCR、图例锚定、视觉检查与验证的多智能体管线——每样本在可追溯的模型评估包(MEP)中记录每一步。在FinMME上——AgentFinVQA较骨干匹配的零样本基线以专有骨干(Gemini-3 Flash)提升+7.68pp(71.24%对63.56%,McNemar p≈1.1×10⁻¹⁶)——以本地部署的开放权重Qwen3.6-27B-FP8提升+4.84pp。验证器的裁决也是有用置信信号(确认答案与修订答案的精确准确率68.2%对55.6%)——支持人机协同审查路由。错误分析显示问题误解、图例混淆与抽取错误占失败近三分之二——且是验证器最难检出的类别——指明未来方向。这些结果共同表明:可审计、本地部署的金融图表QA切实可行——开放权重系统保留大部分准确率增益同时实现完全数据驻留。我们发布代码支持可复现评估。
