论文

IPO Finance Agent:超越Finance Agent v2的LLM财务分析师基准——SpaceX(SPCX)IPO与自动量规生成

IPO Finance Agent: Benchmark of LLM Financial Analysts Beyond Finance Agent v2, with Automated Rubric Generation, on the SpaceX (SPCX) IPO

智能体系统Agent任务评测

摘要

Finance Agent v2(Vals AI出品)已成为在财务任务上评估Anthropic Claude与OpenAI ChatGPT前沿语言模型的参照基准。但它狭窄地处理上市公司定期报告(SEC 10-K与10-Q文件)——其智能体测试框架依赖朴素、未增强的块检索。任务设计与检索方式都未处理IPO尽职调查的独特挑战。SEC S-1文件把历史财务报表、治理结构、备考与共同控制会计处理、资本形成叙事与承销敏感风险披露合并进远长于典型定期文件的文档。这就是为什么我们介绍IPO Finance Agent——沿任务域与检索架构两个方向扩展Finance Agent v2框架。实验期间——原Finance Agent v2框架因文档长度基本无法产出任何与SpaceX S-1文件相关的输出。因此我们不得不以上下文检索改进智能体框架——这是对长文档更现实、更行业标准的做法。我们还构建1,000道IPO尽调题数据集——公开其中70道SpaceX(SPCX)S-1题以支持可复现性——其余保密以防基准污染。此外——我们引入评估器-优化器管线自动生成基准评估量规:从模型答案抽取候选事实、合并为草拟标准——再自动审计遗漏、幻觉、错级项与冗余——LLM反馈驱动迭代修复、定向增补与去重。人类专家仅部署前审查最终量规。结果表明:受评最佳模型智谱GLM-5.2达79.8%准确率——Pareto前沿上最具成本效益的小米MiMo-2.5 Pro以每查询0.05美元达略低的77.2%——超过现Finance Agent v2排行榜上限(Google Gemini 3.5 Flash每查询2.51美元57.9%)。代码与数据发布于GitHub https://github.com/benstaf/ipoagent。