论文

评估LLM投资逻辑:面向个性化金融Agent的现实基准

Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents

模型评测基准与评测资源

摘要

投资能力本质上是个性化的:对于投资者而言,相同的市场证据可能适用于不同目标、时间框架、投资组合和风险边界。然而,金融LLMs(语言模型)通常仅通过静态问答或最终利润与损失来评估,前者忽略了代理关系;后者无法揭示是否盈利行动基于收益、行为一致性还是偶然的。我们询问社区是否正在使用错误的尺子来评价后果性的代理。我们引入了\textsc{InvestLogicBench},这是一个包含151名真实投资者的201,247个文档决策的过程化基准。每个回合都实例化了一个P$\rightarrow$E$\rightarrow$R$\rightarrow$D$\rightarrow$O轨迹:投资者的Profile(特征)、可观察的市场事件、投资理由、执行的Decision(行动)和延迟的Outcome(结果)。公开还包括Profile构建、点时间事件绑定、结构化的逻辑、时间框架、结果以及后评估,支持理解、基于Profile条件生成和端到端重放。在四大领先LLMs中,逻辑合理性接近4/5,但事件基础性仅0.8-2.8/5;回报与过程质量也存在分歧。这些结果暴露了经过修饰但缺乏根基的推理,最终评估隐藏了结果。我们进一步认为P$\rightarrow$E$\rightarrow$R$\rightarrow$D$\rightarrow$O应该是一个数据系统接口,要求版本化的Profile、时间证明、可检查的检索、决策日志和可重放的结果。金融是我们对更广泛的一类个性化、后果性代理进行压力测试的机会。

评估LLM投资逻辑:面向个性化金融Agent的现实基准:论文配图
图1:金融领域的“能力-绩效悖论”。 (左)在为期 7 周的实时美国股票交易竞赛中,LLM 自主代理人与人类专家代理人之间的累积权益曲线。 DeepSeek-V3 获得了最高的累积回报,显着优于标准普尔 500 基准,而 GPT-5 和 Claude-Sonnet-4.5 等模型在抓住机会方面表现不佳。关键的市场拐点突出了专家逻辑与模型行为相背离的时期。 (右)基础能力倾向分数与现实世界累积回报之间的比较分析。它表明,一般基准的卓越表现无法可靠地转化为金融分析敏锐度或有效的现实世界交易执行。