论文

FinBoardBench:通过棋盘游戏模拟对 LLM 的动态财富管理和战略财务推理进行基准测试

FinBoardBench: Benchmarking Dynamic Wealth Management and Strategic Financial Reasoning of LLMs via Board Game Simulations

模型评测基准与评测资源

摘要

近期,大语言模型(LLM)在静态金融推理和简单的动态交易任务中取得了优异的性能。然而,现有的静态财务基准不足以评估LLM在现实环境中的动态财富管理和财务决策能力。为了弥补这一差距,我们推出了 FinBoardBench,这是一个基于三个经典金融棋盘游戏的评估套件:《现金流》、《收购》和《大富翁》。 FinBoardBench 评估一套全面的财务技能,包括个人现金流管理与债务平衡、企业投资和收购预测,以及与资产拍卖的竞争性贸易谈判。我们对 9 个高级 LLM 的实验表明,虽然它们表现出基本的长期规划和投资逻辑,但它们无法有效地利用复杂的交互来获取利润,并且它们强大的静态推理性能并不能转化为成功的动态决策。值得注意的是,他们倾向于优先考虑立即收购资产而不是保持充足的流动性,这使得他们很容易受到随机事件引发的金融危机的影响。我们希望FinBoardBench能够为未来基于LLM的更加智能的决策系统提供有价值的参考。