论文
BankerToolBench:评估AI智能体在端到端投资银行工作流中的表现
BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows
摘要
现有AI基准缺乏保真度,无法评估专业工作流上具有经济意义的进展。为了在高价值、劳动密集型职业中评估前沿AI智能体,我们提出BankerToolBench(BTB):一个开源基准,涵盖初级投资银行家日常执行的端到端分析工作流。为构建植根于真实工作环境、具有生态效度的基准,我们与来自领先机构的502名投资银行家合作。BTB要求智能体通过检索资料室、使用行业工具(行情数据平台、SEC文件数据库)并生成多文件交付物——包括Excel财务模型、PowerPoint路演材料与PDF/Word报告——来执行资深银行家的请求。人类银行家完成一个BTB任务最多需要21小时,凸显了将此类工作成功委托给AI的经济价值。BTB支持对任意LLM或智能体进行自动化评估,依据资深投资银行家定义的100多项评分准则对交付物打分,以刻画利益相关方的效用。测试9个前沿模型后发现,即便表现最好的模型(GPT-5.4)也有近一半评分准则未达标,且银行家认为其0%的输出达到可交付客户的标准。我们的失败分析揭示了关键障碍(如跨交付物一致性崩溃)以及智能体AI在高风险专业工作流中的改进方向。
