论文
Hedge-Bench:面向金融分析中困难现实任务的智能体基准
Hedge-Bench: Benchmarking Agents on Hard, Realistic Tasks Pertaining to Financial Reasoning
摘要
人工智能代理可以越来越多地处理财务分析的机械任务:检索文档、计算公式、更新电子表格。更困难、更有价值的挑战是通过定义专家分析师工作的开放式问题进行推理。现有的基准测试无法捕获此类问题,而那些尝试评估开放式推理的基准测试则依赖于引入噪声和循环的模型判断输出。我们提出了 Hedge-Bench 1.0:基于 102 项实际在职任务的基准,这些任务基于专业对冲基金分析师使用相关信息源的明确推理痕迹。这种方法可以根据经过验证的专家步骤进行确定性评分。前沿模型和代理在基准测试中的得分低于 16%。我们在 github.com/Trata-Inc/trata-hedge-bench 上发布了数据集和评估工具。
