论文

PortBench:面向LLM驱动投资组合管理的相关性感知全流程基准

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

模型评测基准与评测资源

摘要

大语言模型在不同的财务任务中表现出了强劲的表现,但作为一项关键的财务决策任务的投资组合管理(PM)仍然缺乏基准。现有基准存在两个主要差距:它们忽略了跨资产相关结构,因此无法区分真正多元化的投资组合和集中投资组合,并且无法评估现实场景中完整的 PM 决策流程。我们推出 PortBench,这是一个跨越十年来六种异构资产类别的基准。 PortBench 由两个互补层组成:一个包含 7 个任务模板中 6,269 个基于相关性的问题的静态 QA 数据集,以及一个反映完整 PM 决策周期的动态五阶段分配管道。为了评估这些层,我们引入了两个专用指标:双层相关性得分,用于衡量所提议的投资组合是否利用类间对冲并避免类内集中;以及 CEPS,这是一种量化推理错误如何在管道阶段复合的指标。我们进一步评估三种历史压力状况和风险状况下的策略稳健性和投资者一致性。通过评估十个前沿大语言模型,我们发现尽管静态财务质量保证方面表现强劲,但 90% 的模型配置文件组合未能超越基本的等权重分配,并且满足每个程序约束的模型在压力下仍然会遭受灾难性的损失。我们的源代码可在 \href{https://github.com/AgenticFinLab/portbench}{this https URL} 获取。