论文
FrontierFinance:现实世界金融任务的长期计算机使用基准
FrontierFinance: A Long-Horizon Computer-Use Benchmark of Real-World Financial Tasks
摘要
随着知识密集型行业对人工智能驱动的劳动力流失的担忧加剧,现有基准无法衡量定义实用专业知识的任务的绩效。尤其是金融业,被认为是人工智能暴露风险较高的领域,但缺乏强有力的基准来跟踪现实世界的发展。当前 大语言模型 (LLM) 部署中缺乏明确的问责机制,加剧了这一差距。为了解决这个问题,我们引入了 FrontierFinance,这是一个长期基准,涵盖五个核心财务模型的 25 项复杂财务建模任务,每项任务平均需要超过 18 个小时的熟练人力才能完成。该基准由金融专业人士开发,反映了行业标准的金融建模工作流程,并配有详细的结构化评估规则。我们聘请人类专家来定义任务、创建评分标准、对 LLM 进行评分,并按照人类基线自行执行任务。我们证明,与当前最先进的系统相比,我们的人类专家平均得分更高,并且更有可能提供可供客户使用的输出。