论文
FrontierFinance:度量金融智能体前沿智能的高难度基准
FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents
摘要
AI智能体正日益被部署用于专业投资研究,然而目前还没有基准能捕捉完整投资者工作流的复杂性。现有基准主要针对金融数据抽取,这是当前模型已基本饱和的狭窄切片,而基于参照的指标和通用的LLM-as-a-judge评分难以应对真实分析师查询所要求的开放式、长篇回答。我们提出FrontierFinance,一个完全开放的基准,涵盖完整投资者工作流中六个关键用例,包含220个专家编写的查询和11,543条带来源归因的评分规则。FrontierFinance比现有公开金融基准更广也更难。在限定于公开可得数据的统一评测框架下评估前沿模型和智能体系统,我们发现是工具框架(harness)而非模型本身强烈地塑造了质量与效率;Samaya的内部系统以56.0%领先,以约2.2倍更低的成本超过最强前沿模型(Claude Fable 5,49.2%);最佳开放权重模型(Kimi K3,46.4%)以4.5倍更低的成本几乎追平最佳专有模型。筛选与发现(Screening & Discovery)以及行业、产业与宏观(Sector, Industry & Macro)是所有系统中最难的用例,即使是最佳系统也仅达到33%和39%。我们公开了数据集和评分代码。
