论文

FinixDoc:在饱和基准之外重新思考金融文档解析

FinixDoc: Rethinking Financial Document Parsing Beyond Saturated Benchmarks

摘要

金融文档解析需要准确性、结构一致性与可验证性,而现有基准往往无法反映这些要求。我们提出FinixDoc,一个面向真实金融文档的端到端智能体解析系统,其核心解析器为FinixDoc-VL——一个基于Qwen3-VL-4B构建的4B规模视觉语言模型。为刻画基准表现与部署表现之间的差距,我们引入一个文档解析能力矩阵,沿两个实用轴组织:视觉质量与文档规模。在该矩阵指导下,FinixDoc-VL采用领域适配的训练配方,结合同形字感知对比学习与带复合领域特定奖励的多阶段强化学习。为更好地发挥我们在低质量金融文档数据上的积累优势并支撑大规模、高质量数据生产,我们进一步构建了带置信度感知专家审核的人机协同数据工厂流水线。在评估方面,我们构建了FinixDocBench,一个覆盖数字原生、相机拍摄、超大页数和内部工作流场景的金融领域评估套件,并随本技术报告发布一个经合规审核的子集。在其主子集上,FinixDoc-VL在受评基线中取得最高总分(81.43),超出次优开源模型5.13分,其中在内部金融工作流上增益最大(FinixInner:84.08对78.73)。

FinixDoc:在饱和基准之外重新思考金融文档解析:论文配图
图 5:通过对比学习提出的金融视觉表示适应方法的总体训练框架。给定文档图像及其真实文本,通过金融同形文字替换生成硬负文本。然后使用视觉和多模态生成表示上的双路径对比目标以及监督微调目标来优化模型。