论文

Hedge-Bench:面向金融分析中困难现实任务的智能体基准

Hedge-Bench: Benchmarking Agents on Hard, Realistic Tasks Pertaining to Financial Reasoning

智能体系统Agent任务评测

摘要

人工智能代理可以越来越多地处理财务分析的机械任务:检索文档、计算公式、更新电子表格。更困难、更有价值的挑战是通过定义专家分析师工作的开放式问题进行推理。现有的基准测试无法捕获此类问题,而那些尝试评估开放式推理的基准测试则依赖于引入噪声和循环的模型判断输出。我们提出了 Hedge-Bench 1.0:基于 102 项实际在职任务的基准,这些任务基于专业对冲基金分析师使用相关信息源的明确推理痕迹。这种方法可以根据经过验证的专家步骤进行确定性评分。前沿模型和代理在基准测试中的得分低于 16%。我们在 github.com/Trata-Inc/trata-hedge-bench 上发布了数据集和评估工具。

Hedge-Bench:面向金融分析中困难现实任务的智能体基准:论文配图
图 1:Pass@1 和每个模型的平均密集分数。 Pass@1:在给定环境中单个模型尝试获得完美 4.0/4.0 的概率(通过平均每个环境 8 次尝试来估计)。误差线显示跨环境的任务采样不确定性的 95% 置信区间。密集平均分数:每个模型在 [0,4][0,4] 范围内的细粒度分数(在所有环境和所有尝试中取平均值)。