论文
面向金融文档处理的多智能体 LLM 架构基准测试:编排模式、成本—精度权衡与生产扩展策略的对比研究
Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies
摘要
采用大语言模型(LLM)从金融文档中提取结构化信息的进程迅速加快,但生产部署面临根本性的架构决策,而经验指导却很有限。我们提出一个系统性基准,比较四种多智能体编排架构:顺序流水线、并行扇出加合并、分层主管—工人和反思式自校正循环。这些架构在 10,000 份 SEC 备案文件(10-K、10-Q 和 8-K 表格)语料上、跨五个前沿与开放权重 LLM 进行评估。评估覆盖 25 类抽取字段,涉及治理结构、高管薪酬与财务指标,沿五个维度测量:字段级 F1、文档级准确率、端到端延迟、单文档成本和 token 效率。我们发现,反思式架构取得最高的字段级 F1(0.943),但成本是顺序基线的 2.3 倍;分层架构则在成本—精度 Pareto 前沿上占据最有利位置(F1 0.921,成本为 1.4 倍)。我们进一步给出语义缓存、模型路由和自适应重试策略的消融研究,表明混合配置能以仅 1.15 倍基线成本恢复反思式架构 89% 的精度增益。我们从每日 1K 到 100K 文档的扩展分析揭示了不明显的吞吐—精度退化曲线,可为容量规划提供依据。这些发现为在受监管金融环境中部署多智能体 LLM 系统的从业者提供了可操作的指导。