论文

FinPersona-Bench:自主金融代理纵向心理测量稳定性的基准

FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地被部署为自治金融代理,这些代理以明确的行为指令初始化,例如“保留资本”或“避免投机性赌注”,这些指令旨在管理整个部署过程中的每个决策。然而,在实践中,随着市场环境长期积累,这些指令逐渐失去其行为影响力,我们将这种现象正式称为指令显着性衰退(MSD)。为了客观地衡量 MSD,我们引入了 FinPersona-Bench,这是一个模拟基准,其中合成市场将可观察价格与隐藏的基本价值脱钩,从而能够对三种失败模式进行可证伪的评估:平静市场中没有信号的交易、崩盘期间的恐慌性抛售以及投机泡沫期间忽略基本价值。对 18 个领先的前沿和开源 LLM 进行了评估,每个都分配了从严格资本保值到积极增长的三种行为特征之一,表明 MSD 随着时间的推移而复合,并且依赖于模型。在碰撞场景中,静态代理与接受定期任务授权重新校准的代理之间的行为差​​距从模拟的第一个季度到最后一个季度增长了 4.4 倍。任务授权重新校准的影响并不都是积极的:它始终有助于低信号市场中的保守智能体,但在相同环境下却会严重恶化激进智能体的行为。这些发现表明,可靠的长期部署需要根据代理概况和市场制度进行选择性的、具有强制意识的任务授权重新校准。