论文
Herculean:面向金融智能的智能体基准
Herculean: An Agentic Benchmark for Financial Intelligence
摘要
随着AI智能体的不断进步,核心问题已不再是它们能否解决孤立且定义良好的金融任务,而是能否可靠地承担金融专业工作。现有金融基准只能部分反映这种能力,因为它们主要评估问答、检索、摘要和分类等静态能力。我们提出Herculean,首个面向智能体金融技能的基准,覆盖交易、对冲、市场洞察和审计四类代表性工作流。每个工作流都被实例化为标准化的基于MCP的技能环境,拥有各自的工具、交互动态、约束与成功标准,从而能够对异构智能体系统进行一致的端到端评估。在前沿智能体上的评测显示,智能体在交易和市场洞察上表现相对较好,但在对冲和审计上困难重重,而后两者正是长程协调、状态一致性与结构化验证至关重要的场景。总体而言,我们的结果揭示了当前智能体在高风险金融工作流中将金融推理转化为可靠工作流执行方面的关键差距。
