论文
FinFIRST:金融信息检索、采购和可追溯性的基准搜索代理
FinFIRST: Benchmarking Search Agents for Financial Information Retrieval, Sourcing and Traceability
摘要
金融检索对于大语言模型代理人来说是一项要求很高的任务,不仅需要正确的最终答案,还需要暂时有效的信息检索、权威来源选择、实体和期间对齐、单位和定义一致性以及所有结论的可验证证据。现有的基准主要仅评估最终答案,因此很难定位错误或评估答案是否有充分依据。为了解决这一差距,我们引入了 FinFIRST(财务信息检索、采购和可追溯性),这是第一个通过原子准则联合评估答案和支持证据的财务基准。 FinFIRST 包含 123 项由专家编写的任务,涵盖不同的难度范围,通过 18 个领域的分类法、六轴覆盖蓝图、138 个财务来源的注册表、50 多名财务专家的贡献以及六阶段质量控制管道,根据现实世界金融场景的聚合模式构建。每项任务都附有一个基于证据的参考包,该参考包分解为三个维度的原子标准:原始信息获取、来源验证以及计算和答案形成。我们在统一的工具设置下评估了 15 种模型配置。 Claude-Opus-5 获得最高原子分数 87.59%,而 GPT-5.6-Sol 获得最高严格通过率 71.54%。计算和答案形成始终落后于跨系统的原始信息获取。 FinFIRST 将最终答案的正确性作为主要目标,同时使支持研究过程可测量、可验证和可诊断。